---
title: "Pxpipe Review: 60% weniger Claude-Code-Kosten?"
canonical: https://wavect.io/de/blog/text-as-image-token-savings/
language: de
description: "Pxpipe im Test: Wie Bildkontext Claude-Code-Kosten senkt, welche aktuellen Benchmarks das stützen und warum IDs, Hashes und Zahlen Text bleiben müssen."
image: "https://wavect.io/img/blog/headers/header_text-as-image-token-savings.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

10 Min Lesezeit · 3. Juli 2026 Zuletzt geprüft 7. August 2026

[**Weiter**](/de/blog/cost-per-token-vs-cost-per-task/)

# Pxpipe im Test: Senken Bilder Claude-Code-Kosten wirklich um 60%?

TL;DR

Pxpipe ist ein lokaler MIT-Proxy, der umfangreichen Kontext als Bilder an Modelle sendet. Das Projekt meldet 59 bis 70 Prozent niedrigere End-to-End-Rechnungen und nahezu gleiche SWE-bench-Ergebnisse, aber seine aktuellen Exact-Recall-Tests reichen von 14 von 15 bei Gemini und 13 von 15 bei Fable bis 2 von 15 bei Opus 5 und 0 von 15 bei GPT-5.6 Sol. Nutze es nur für umfangreichen Kontext, bei dem sinngemäße Wiedergabe genügt. IDs, Hashes, Secrets, Namen und exakte Zahlen müssen Text bleiben. Vergleiche immer mit einer korrekt gecachten Basis und prüfe die Qualität auf deinem Modell und Workload. Geprüft am 7. August 2026.

Passende Leistung: [KI Enablement](/de/services/ai-enablement/)

Ein Trick macht gerade die Runde: Claude Fable 5 rund 60% günstiger betreiben, indem du die schweren Teile deiner Anfrage, also System-Prompt, Tool-Dokumentation, alte History und eingefügten Code, in ein Bild verwandelst, bevor die Anfrage beim Modell ankommt.

Die Logik klingt absurd, und genau deshalb ist sie viral gegangen. Ein Bild kostet das Modell eine feste Anzahl Tokens, abhängig von seiner Pixelgröße, nicht davon, wie viel Text darin steckt. Du kannst also viele Zeichen in ein dichtes Bild packen und bezahlst für die Pixel, nicht für den Text.

Das Tool, das gerade kursiert, ist [pxpipe](https://github.com/teamchong/pxpipe), ein quelloffener (MIT) lokaler Proxy. Er sitzt zwischen deinem Rechner und der API und rendert den umfangreichen, weitgehend statischen Kontext in dichte PNG-"Seiten", bevor die Anfrage deinen Laptop verlässt. Die Demo im Repository zeigt eine mehrstufige Aufgabe, die als reiner Text **42,21 $** kostet und mit pxpipe **6,06 $**. Behauptet wird eine **um 59 bis 70% niedrigere End-to-End-Rechnung** bei Fable 5 zu aktuellen Listenpreisen.

Also genial oder Unsinn? Die ehrliche Antwort: Die Physik dahinter ist real, die Forschung ist ernst zu nehmen, und der Fehlermodus ist schlimm genug, dass du das Ganze für die meiste Produktionsarbeit nicht standardmäßig einschalten solltest. Hier das ganze Bild, mit den Vorbehalten, die die virale Version weglässt.

## Warum das tatsächlich funktioniert: die Preis-Physik

Text und Bilder werden zum selben Preis pro Token abgerechnet, aber sehr unterschiedlich gezählt.

Text wird nach Inhalt tokenisiert. Mehr Zeichen, mehr Tokens, mehr Kosten. Ein Bild bepreist Anthropic stattdessen nach seiner Pixelfläche, mit einer groben Formel von `(Breite x Höhe) / 750` Tokens, und die Zahl ist gedeckelt (Bilder werden so skaliert, dass die lange Kante bei rund 1568px bleibt, was am oberen Ende nahe 1.600 Tokens pro Bild liegt). Der springende Punkt: Diese Zahl kümmert sich nicht darum, ob das Bild ein leeres Rechteck oder eine Wand aus Text ist.

Auf echtem Claude-Code-Traffic misst pxpipe, dass dichter Inhalt wie Code und JSON etwa 3,1 Zeichen pro Bild-Token unterbringt, gegenüber rund 1,9 Zeichen pro Text-Token. Sobald dein Text dichter als etwa 19 Zeichen pro Token ist, beginnt sich das Rendern als Bild zu rechnen. Ein Block, der als Text 25k Tokens kosten würde, kommt so als rund 2,7k Bild-Tokens zurück. Daher kommt die 60%-Schlagzeile.

Das bekommt das Modell tatsächlich statt deines Textes zu sehen:

![Eine dichte Wand aus whitespace-minimiertem Text als einzelnes Bild, rund 48k Zeichen in etwa 2,7k Bild-Tokens gepackt, mit einem OCR-Hinweisbanner oben](/img/blog/text-as-image-what-the-model-sees_hu_75a279e2854fd825.webp)Rund 48k Zeichen System-Prompt und Tool-Dokumentation, etwa 25k Tokens als Text, gerendert als rund 2,7k Bild-Tokens auf einer Seite. Quelle: das [pxpipe](https://github.com/teamchong/pxpipe) -Repository (MIT), zur Illustration.

Ein Detail, das die virale Version übergeht: Weil jedes Bild nahe 1.600 Tokens gedeckelt ist, kannst du keinen unbegrenzten Kontext auf eine einzige riesige Fläche kippen. Das Tool rendert viele Seiten, nicht ein Poster. Die Ersparnis ist real, aber sie entsteht durch das Kacheln von dichtem Text über mehrere gedeckelte Bilder, nicht durch Magie.

## Das ist kein Hack. Es ist eine Forschungsrichtung.

Der kontraintuitive Teil, dass Bilder von Text günstiger sein können als Text, ist kein Proxy-Tool-Gimmick. Es ist ein aktives Forschungsfeld.

Im Oktober 2025 veröffentlichte DeepSeek [DeepSeek-OCR: Contexts Optical Compression](https://arxiv.org/abs/2510.18234) und zeigte, dass ein Vision-Modell Text aus einer kleinen Menge visueller Tokens bei rund 10x Kompression dekodieren kann, während es etwa 97% OCR-Genauigkeit hält, solange das Kompressionsverhältnis unter 10x bleibt. Andrej Karpathy griff das auf und argumentierte, dass Text-Tokens vielleicht verschwenderischer "historischer Ballast" seien und dass Modelle mit Bildern von Text effizienter fahren könnten. Folgearbeiten wie [Text or Pixels? It Takes Half](https://arxiv.org/html/2510.18279v1) berichten ähnliche Token-Ersparnisse bei visuellen Text-Eingaben.

Die Idee ist also legitim, und die Long-Context-Ökonomie ist wirklich interessant. pxpipe ist nur ein früher, aggressiver Versuch, das auf heutigen kommerziellen APIs einzulösen, bevor die Modelle darauf trainiert sind, es gut zu machen. Und "bevor die Modelle darauf trainiert sind, es gut zu machen" ist genau der Punkt, an dem der Ärger beginnt.

## Der Haken, der es für die meiste Arbeit absurd macht

Text als Bild zu rendern ist verlustbehaftet, und der Verlust ist stumm.

Wenn das Modell ein gerendertes Zeichen falsch liest, wirft es keinen Fehler und meldet keine niedrige Konfidenz. Es erfindet selbstbewusst etwas. Die README von pxpipe dokumentiert das ehrlich: Bei einem Needle-in-a-Haystack-Test, bei dem das Modell exakte 12-stellige Hex-Strings aus dichtem gerendertem Inhalt abrufen sollte, erreichte Fable 5 **13 von 15** und Opus **0 von 15**. Die README beschreibt einen realen Fall, in dem das Modell den Namen einer Person aus gerenderter Chat-History abrief und ihn selbstbewusst falsch angab.

Das ist das ganze Risiko in einem Satz: **Alles, was du byte-genau zurückbekommen musst, muss Text bleiben.** IDs, Hashes, Secrets, exakte Zahlen, präzise Namen. pxpipe hält aktuelle Turns und exakte Bezeichner genau deshalb als Text neben den Bildern.

Ein paar Dinge, die die Schlagzeile überspringt:

- **Es ist modellabhängig.** pxpipe nutzt standardmäßig Fable 5 und GPT-5.6, die Modelle, die dichten gerenderten Text am besten lesen. Opus 4.8 und GPT-5.5 sind nur opt-in, weil sie gerenderten Kontext häufiger falsch lesen. Der Trick, der dir bei einem Modell 60% spart, kann bei einem anderen still den Kontext beschädigen.
- **Es fügt Latenz hinzu.** Große Anfragen als PNG zu kodieren kostet Zeit, bevor die Anfrage deinen Rechner überhaupt verlässt.
- **Es steht in Wechselwirkung mit Prompt-Caching.** Dein größter, statischster Kontext, System-Prompt und Tool-Dokumentation, ist zugleich der ideale Kandidat für Prompt-Caching, das wiederholte Tokens bereits stark rabattiert. Auf dem GPT-Pfad verzichtet pxpipe auf native Cache-Marker. Kontext als Bild zu rendern und Kontext zu cachen zielen auf dieselben Tokens, also ist der ehrliche Vergleich der gegen eine sauber gecachte Basis, nicht gegen eine naive.

## Wann es sich lohnt, und wann es dich verbrennt

Das ist kein Ja oder Nein. Es ist eine Routing-Entscheidung, dieselbe Disziplin, die wir bei der Modellauswahl anwenden. Passe die Technik an die Nutzlast an.

| Guter Fit fürs Rendern | Das nicht rendern |
| --- | --- |
| Große, statische System-Prompts und Tool-Dokumentation | Alles Byte-Genaue: IDs, Hashes, Secrets, Keys |
| Read-only Referenzkontext und lange Dokumente | Exakte Zahlen, die du berechnest oder zitierst |
| Zusammengeklappte, ältere Konversations-History | Aktuelle Turns, über die das Modell präzise nachdenken muss |
| Fable 5 oder andere starke Bild-Leser | Opus-geroutete oder vision-schwächere Workloads |
| Massenkontext, bei dem der Sinn reicht | Alles, wo ein stummer Lesefehler inakzeptabel ist |

Wenn dein Workload ein riesiger, stabiler Instruktionsblock ist, der einen Fable-5-Agenten füttert, der meist nur den Sinn braucht, kann Rendern ein echter Gewinn sein. Wenn es ein Compliance-Workflow ist, der exakte Zahlen und Bezeichner bewegt, ist derselbe Trick eine stille Belastung.

## Wo das in einen echten Kosten-Stack passt

Kontext als Bild zu rendern ist ein Hebel, und nicht der erste, den wir ziehen würden. Bevor du zu einem verlustbehafteten Trick greifst, gewinnen meist die langweiligen Hebel, und sie riskieren deine Daten nicht:

- **Prompt-Caching** für das statische Präfix, verlustfrei und ohnehin groß.
- **Model-Routing:** günstige Modelle für mechanische Arbeit, starke Modelle für Urteilsvermögen. Siehe [wie wir Arbeit über Fable, Opus, Sonnet und Haiku routen](/de/blog/coding-with-claude-fable-5/).
- **Kosten pro erledigter Aufgabe messen, nicht Preis pro Token,** denn das ist die Zahl auf deiner Rechnung. Siehe [günstiger pro Token, teurer pro Antwort](/de/blog/cost-per-token-vs-cost-per-task/).
- **Ein Gateway,** um Fallback, Caching und Ausgabenlimits zu bündeln. Siehe unseren [LLM-Gateway-Vergleich](/de/blog/llm-gateway-router-comparison-2026/).
- **Self-Hosting oder Open Weights,** wenn Volumen und Datenresidenz es rechtfertigen, behandelt in [den echten Kosten von Self-Hosting von LLMs in der EU](/de/blog/self-hosting-llms-eu-cost/).

Kontext als Bild zu rendern sitzt am aggressiven Ende dieser Liste: hohes Sparpotenzial, echtes Korrektheitsrisiko, einen Pilotversuch auf der richtigen Nutzlast wert, sobald die sichereren Hebel stehen.

Zu entscheiden, welchen Hebel du in welcher Reihenfolge ziehst, gemessen an einer echten Rechnung statt an einem Benchmark, ist die Arbeit hinter unserem [KI Setup Service](/de/services/ai-enablement/): erst die laufenden Kosten instrumentieren, dann die verlustfreien Hebel ausschöpfen, und alles Verlustbehaftete hinter ein Eval hängen, das einen verfälschten Wert auch wirklich fängt. [Twinsoft AI](/de/case-studies/twinsoft-ai/) ist dieselbe Reihenfolge an einem Produktionssystem, und unser [Guide zur Technologieauswahl](/de/software-development-guide/how-to-choose-a-tech-stack-for-mvp/) nennt die allgemeine Regel: entscheide gegen die Randbedingung, deren Umkehr teuer wird.

![Kevin Riedl](/img/team/kevin.webp)

"Die Preis-Physik ist real und die Forschung ist ernst zu nehmen. Aber eine 60%-Ersparnis, die gelegentlich einen Hash oder einen Namen erfindet, ist keine Ersparnis, sondern aufgeschobenes Debugging. Rendere den Massenkontext, der nur den Sinn braucht, halte jeden exakten Wert als Text, und richte es nie auf ein Modell, das Bilder schlecht liest."

## Häufige Fragen

### Ist es sicher, Kontext für die Produktion als Bild zu rendern?

Nur für Kontext, bei dem ein stummer Lesefehler akzeptabel ist, etwa große statische Instruktionen oder Read-only-Referenzmaterial, das an ein Modell geht, das Bilder gut liest. Es ist verlustbehaftet, halte also alles Byte-Genaue (IDs, Hashes, Secrets, exakte Zahlen) als Text. Behandle es als gezielte Optimierung auf der richtigen Nutzlast, nicht als Standard.

### Bricht das Rendern von Kontext das Prompt-Caching?

Es konkurriert damit. Dein größter statischer Kontext ist zugleich der beste Kandidat für Prompt-Caching, das verlustfrei ist. Auf dem GPT-Pfad verzichtet pxpipe auf native Cache-Marker. Vergleiche das Rendern also gegen eine sauber gecachte Basis, nicht gegen eine ungecachte, sonst überschätzt du den Gewinn.

### Warum liest Opus gerenderten Text schlechter als Fable?

Es ist modellabhängig. Im Hex-Recall-Test von pxpipe erreichte Fable 5 13 von 15 und Opus 0 von 15, deshalb nutzt pxpipe standardmäßig Fable 5 und GPT-5.6 und macht Opus opt-in. Derselbe Trick, der bei einem starken Bild-Leser Geld spart, kann bei einem schwächeren den Kontext beschädigen.

### Ist das dasselbe wie DeepSeek-OCR?

Es ist dieselbe zugrunde liegende Idee, optische Kontext-Kompression, nur anders angewandt. DeepSeek-OCR ist ein Modell, das darauf trainiert ist, Text aus einer kleinen Menge visueller Tokens bei rund 10x Kompression zu dekodieren. pxpipe ist ein Proxy, der deinen Kontext für bestehende kommerzielle APIs rendert, die nicht speziell dafür trainiert wurden, weshalb der Verlust auftaucht.

### Wie viel spart es tatsächlich?

Das pxpipe-Repository behauptet eine um 59 bis 70% niedrigere End-to-End-Rechnung bei Fable 5 und zeigt eine Demo-Aufgabe mit 42,21 $ als Text gegenüber 6,06 $ gerendert. Behandle das als die Zahl des Tool-Autors auf seinem eigenen Workload und miss auf deinem nach, gegen eine gecachte Basis.

## Fazit

Also genial oder absurd? Beides. Der Mechanismus ist real, Bild-Tokens werden nach Pixeln bepreist, und ernstzunehmende Forschung deutet in dieselbe Richtung. Aber es an Modelle zu schrauben, die nicht dafür trainiert wurden, tauscht Geld gegen stille Fehler, und stille Fehler sind die teuerste Sorte.

Nutze es so, wie du jede aggressive Optimierung nutzt: bewusst, auf der passenden Nutzlast, mit den exakten Werten als Text und den sichereren Hebeln, Caching, Routing, Messung, bereits in Betrieb. Dann ist das Rendern von Massenkontext ein scharfes Werkzeug. Schalte es überall ein, und es reicht dir irgendwann eine selbstbewusst falsche Antwort, die du nie kommen siehst.

## Das könnte dich auch interessieren..

[**Günstiger pro Token. Teurer pro Antwort.** Warum die Kosten pro erledigter Aufgabe, nicht der Preis pro Token, die Zahl auf deiner Rechnung sind, und wie du sie auf deinem eigenen Workload misst.](/de/blog/cost-per-token-vs-cost-per-task/) [**AI Enablement vs eine generische KI-Beratung** Die eine reicht dir ein Strategiedeck. Die andere liefert ein laufendes Setup auf deiner Infrastruktur, das dein Team besitzt und betreiben kann.](/de/compare/ai-enablement-vs-generic-ai-consultancy/)

Modelle und Infrastruktur

## In diesem Cluster weiterlesen

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

[Mit dem Grundlagenartikel starten**LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen**](/de/blog/self-hosting-llms-eu-cost/)

- [LiteLLM selbst hosten: Production-Guide 2026](/de/blog/self-host-litellm-production-2026/)
- [KI-fähiges Unternehmenswiki: Architektur und Aufbau](/de/blog/ai-ready-company-wiki/)
- [Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026](/de/blog/claude-text-watermark-api-2026/)
- [OpenKB Review: Knowledge Compiler vs. RAG](/de/blog/openkb-review-vs-rag/)
- [Unsloth Desktop im Test: Private lokale KI-Workstation?](/de/blog/unsloth-desktop-local-ai-workstation-review/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

10 Min Lesezeit · 3. Juli 2026 Zuletzt geprüft 7. August 2026

[**Weiter**](/de/blog/cost-per-token-vs-cost-per-task/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/text-as-image-token-savings/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-07",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-07",
      "url": "https://wavect.io/de/blog/text-as-image-token-savings/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Pxpipe ist ein lokaler MIT-Proxy, der umfangreichen Kontext als Bilder an Modelle sendet. Das Projekt meldet 59 bis 70 Prozent niedrigere End-to-End-Rechnungen und nahezu gleiche SWE-bench-Ergebnisse, aber seine aktuellen Exact-Recall-Tests reichen von 14 von 15 bei Gemini und 13 von 15 bei Fable bis 2 von 15 bei Opus 5 und 0 von 15 bei GPT-5.6 Sol. Nutze es nur für umfangreichen Kontext, bei dem sinngemäße Wiedergabe genügt. IDs, Hashes, Secrets, Namen und exakte Zahlen müssen Text bleiben. Vergleiche immer mit einer korrekt gecachten Basis und prüfe die Qualität auf deinem Modell und Workload. Geprüft am 7. August 2026.",
  "articleBody": " Blog-Übersicht/AI und Agents/Modelle und Infrastruktur Pxpipe im Test: Senken Bilder Claude-Code-Kosten wirklich um 60%? TL;DR Pxpipe ist ein lokaler MIT-Proxy, der umfangreichen Kontext als Bilder an Modelle sendet. Das Projekt meldet 59 bis 70 Prozent niedrigere End-to-End-Rechnungen und nahezu gleiche SWE-bench-Ergebnisse, aber seine aktuellen Exact-Recall-Tests reichen von 14 von 15 bei Gemini und 13 von 15 bei Fable bis 2 von 15 bei Opus 5 und 0 von 15 bei GPT-5.6 Sol. Nutze es nur für umfangreichen Kontext, bei dem sinngemäße Wiedergabe genügt. IDs, Hashes, Secrets, Namen und exakte Zahlen müssen Text bleiben. Vergleiche immer mit einer korrekt gecachten Basis und prüfe die Qualität auf deinem Modell und Workload. Geprüft am 7. August 2026. Passende Leistung: KI Enablement Ein Trick macht gerade die Runde: Claude Fable 5 rund 60% günstiger betreiben, indem du die schweren Teile deiner Anfrage, also System-Prompt, Tool-Dokumentation, alte History und eingefügten Code, in ein Bild verwandelst, bevor die Anfrage beim Modell ankommt. Die Logik klingt absurd, und genau deshalb ist sie viral gegangen. Ein Bild kostet das Modell eine feste Anzahl Tokens, abhängig von seiner Pixelgröße, nicht davon, wie viel Text darin steckt. Du kannst also viele Zeichen in ein dichtes Bild packen und bezahlst für die Pixel, nicht für den Text. Das Tool, das gerade kursiert, ist pxpipe, ein quelloffener (MIT) lokaler Proxy. Er sitzt zwischen deinem Rechner und der API und rendert den umfangreichen, weitgehend statischen Kontext in dichte PNG-\"Seiten\", bevor die Anfrage deinen Laptop verlässt. Die Demo im Repository zeigt eine mehrstufige Aufgabe, die als reiner Text 42,21 $ kostet und mit pxpipe 6,06 $. Behauptet wird eine um 59 bis 70% niedrigere End-to-End-Rechnung bei Fable 5 zu aktuellen Listenpreisen. Also genial oder Unsinn? Die ehrliche Antwort: Die Physik dahinter ist real, die Forschung ist ernst zu nehmen, und der Fehlermodus ist schlimm genug, dass du das Ganze für die meiste Produktionsarbeit nicht standardmäßig einschalten solltest. Hier das ganze Bild, mit den Vorbehalten, die die virale Version weglässt. Warum das tatsächlich funktioniert: die Preis-Physik Text und Bilder werden zum selben Preis pro Token abgerechnet, aber sehr unterschiedlich gezählt. Text wird nach Inhalt tokenisiert. Mehr Zeichen, mehr Tokens, mehr Kosten. Ein Bild bepreist Anthropic stattdessen nach seiner Pixelfläche, mit einer groben Formel von (Breite x Höhe) / 750 Tokens, und die Zahl ist gedeckelt (Bilder werden so skaliert, dass die lange Kante bei rund 1568px bleibt, was am oberen Ende nahe 1.600 Tokens pro Bild liegt). Der springende Punkt: Diese Zahl kümmert sich nicht darum, ob das Bild ein leeres Rechteck oder eine Wand aus Text ist. Auf echtem Claude-Code-Traffic misst pxpipe, dass dichter Inhalt wie Code und JSON etwa 3,1 Zeichen pro Bild-Token unterbringt, gegenüber rund 1,9 Zeichen pro Text-Token. Sobald dein Text dichter als etwa 19 Zeichen pro Token ist, beginnt sich das Rendern als Bild zu rechnen. Ein Block, der als Text 25k Tokens kosten würde, kommt so als rund 2,7k Bild-Tokens zurück. Daher kommt die 60%-Schlagzeile. Das bekommt das Modell tatsächlich statt deines Textes zu sehen: Rund 48k Zeichen System-Prompt und Tool-Dokumentation, etwa 25k Tokens als Text, gerendert als rund 2,7k Bild-Tokens auf einer Seite. Quelle: das pxpipe-Repository (MIT), zur Illustration. Ein Detail, das die virale Version übergeht: Weil jedes Bild nahe 1.600 Tokens gedeckelt ist, kannst du keinen unbegrenzten Kontext auf eine einzige riesige Fläche kippen. Das Tool rendert viele Seiten, nicht ein Poster. Die Ersparnis ist real, aber sie entsteht durch das Kacheln von dichtem Text über mehrere gedeckelte Bilder, nicht durch Magie. Das ist kein Hack. Es ist eine Forschungsrichtung. Der kontraintuitive Teil, dass Bilder von Text günstiger sein können als Text, ist kein Proxy-Tool-Gimmick. Es ist ein aktives Forschungsfeld. Im Oktober 2025 veröffentlichte DeepSeek DeepSeek-OCR: Contexts Optical Compression und zeigte, dass ein Vision-Modell Text aus einer kleinen Menge visueller Tokens bei rund 10x Kompression dekodieren kann, während es etwa 97% OCR-Genauigkeit hält, solange das Kompressionsverhältnis unter 10x bleibt. Andrej Karpathy griff das auf und argumentierte, dass Text-Tokens vielleicht verschwenderischer \"historischer Ballast\" seien und dass Modelle mit Bildern von Text effizienter fahren könnten. Folgearbeiten wie Text or Pixels? It Takes Half berichten ähnliche Token-Ersparnisse bei visuellen Text-Eingaben. Die Idee ist also legitim, und die Long-Context-Ökonomie ist wirklich interessant. pxpipe ist nur ein früher, aggressiver Versuch, das auf heutigen kommerziellen APIs einzulösen, bevor die Modelle darauf trainiert sind, es gut zu machen. Und \"bevor die Modelle darauf trainiert sind, es gut zu machen\" ist genau der Punkt, an dem der Ärger beginnt. Der Haken, der es für die meiste Arbeit absurd macht Text als Bild zu rendern ist",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-08-07",
  "datePublished": "2026-07-03",
  "description": "Pxpipe ist ein lokaler MIT-Proxy, der umfangreichen Kontext als Bilder an Modelle sendet. Das Projekt meldet 59 bis 70 Prozent niedrigere End-to-End-Rechnungen und nahezu gleiche SWE-bench-Ergebnisse, aber seine aktuellen Exact-Recall-Tests reichen von 14 von 15 bei Gemini und 13 von 15 bei Fable bis 2 von 15 bei Opus 5 und 0 von 15 bei GPT-5.6 Sol. Nutze es nur für umfangreichen Kontext, bei dem sinngemäße Wiedergabe genügt. IDs, Hashes, Secrets, Namen und exakte Zahlen müssen Text bleiben. Vergleiche immer mit einer korrekt gecachten Basis und prüfe die Qualität auf deinem Modell und Workload. Geprüft am 7. August 2026.",
  "headline": "Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?",
  "image": "https://wavect.io/img/blog/headers/header_text-as-image-token-savings.svg",
  "inLanguage": "de",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/text-as-image-token-savings/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/text-as-image-token-savings/",
  "wordCount": 2077
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/models-infrastructure/",
      "name": "Modelle und Infrastruktur",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/text-as-image-token-savings/",
      "name": "Pxpipe Review: 60% weniger Claude-Code-Kosten? | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nur für Kontext, bei dem ein stummer Lesefehler akzeptabel ist, etwa große statische Instruktionen oder Read-only-Referenzmaterial, das an ein Modell geht, das Bilder gut liest. Es ist verlustbehaftet, halte also alles Byte-Genaue (IDs, Hashes, Secrets, exakte Zahlen) als Text. Behandle es als gezielte Optimierung auf der richtigen Nutzlast, nicht als Standard."
      },
      "name": "Ist es sicher, Kontext für die Produktion als Bild zu rendern?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Es konkurriert damit. Dein größter statischer Kontext ist zugleich der beste Kandidat für Prompt-Caching, das verlustfrei ist. Auf dem GPT-Pfad verzichtet pxpipe auf native Cache-Marker. Vergleiche das Rendern also gegen eine sauber gecachte Basis, nicht gegen eine ungecachte, sonst überschätzt du den Gewinn."
      },
      "name": "Bricht das Rendern von Kontext das Prompt-Caching?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Es ist modellabhängig. Im Hex-Recall-Test von pxpipe erreichte Fable 5 13 von 15 und Opus 0 von 15, deshalb nutzt pxpipe standardmäßig Fable 5 und GPT-5.6 und macht Opus opt-in. Derselbe Trick, der bei einem starken Bild-Leser Geld spart, kann bei einem schwächeren den Kontext beschädigen."
      },
      "name": "Warum liest Opus gerenderten Text schlechter als Fable?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Es ist dieselbe zugrunde liegende Idee, optische Kontext-Kompression, nur anders angewandt. DeepSeek-OCR ist ein Modell, das darauf trainiert ist, Text aus einer kleinen Menge visueller Tokens bei rund 10x Kompression zu dekodieren. pxpipe ist ein Proxy, der deinen Kontext für bestehende kommerzielle APIs rendert, die nicht speziell dafür trainiert wurden, weshalb der Verlust auftaucht."
      },
      "name": "Ist das dasselbe wie DeepSeek-OCR?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Das pxpipe-Repository behauptet eine um 59 bis 70% niedrigere End-to-End-Rechnung bei Fable 5 und zeigt eine Demo-Aufgabe mit 42,21 $ als Text gegenüber 6,06 $ gerendert. Behandle das als die Zahl des Tool-Autors auf seinem eigenen Workload und miss auf deinem nach, gegen eine gecachte Basis."
      },
      "name": "Wie viel spart es tatsächlich?"
    }
  ]
}
```
