Zum Inhalt springen

98% unserer Codex-Input-Tokens waren gecacht. Ohne Caching wäre die Rechnung 12-mal so hoch

Aktualisiert October 9, 2026 · erstveröffentlicht October 9, 2026

Kurzantwort: In 12 Tagen intensiver Codex-Nutzung mit ChatGPT Pro $100 haben wir 13.0 Milliarden Input-Tokens gesendet und 47 Millionen Output-Tokens zurückbekommen. 97.6% dieses Inputs waren Cache-Treffer. Zu den...

In 12 Tagen intensiver Codex-Nutzung mit ChatGPT Pro $100 haben wir 13.0 Milliarden Input-Tokens gesendet und 47 Millionen Output-Tokens zurückbekommen. 97.6% dieses Inputs waren Cache-Treffer. Zu den API-Preisen von OpenAI kam die Arbeit auf $1,211. Mit denselben Tokens ohne jeden Cache-Treffer wären es $14,198, also 12-mal mehr.

API-Wert von 12 Tagen Codex nach Modell: mit Cache vs. ohne Cache$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraOrange: was wir in API-Preisen bezahlt haben, mit CachingBlau: dieselben Tokens ohne Cache-Treffer
API-Wert von 12 Tagen Codex nach Modell: mit Cache vs. ohne Cache

Warum Coding-Agenten fast nur gecachten Input verbrauchen

Eine Agentenschleife sendet bei jedem Schritt die gesamte Konversation erneut: den System-Prompt, die Tool-Definitionen, die gelesenen Dateien und jedes frühere Tool-Ergebnis. Jeder Schritt fügt ein wenig hinzu und liest alles erneut. Der Input wächst daher mit dem Quadrat der Sitzungslänge, während der Output klein bleibt. Über 12 Tage ergab das ein Verhältnis von Input zu Output von 279:1.

Prompt-Caching hält das bezahlbar. Gecachter Input kostet bei der OpenAI-API ein Zehntel oder weniger des normalen Inputs. GPT-6 Sol, das den größten Teil unserer Arbeit erledigt hat, berechnet $2 pro Million Input-Tokens und $0.10 pro Million gecachter Tokens.

Wohin das Geld floss

ModellInput-TokensGecachtOutput-TokensAPI-WertOhne Cache
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Total13.01B97.6%47M$1,211$14,198
KostenbestandteilAPI-WertAnteil
Gecachter Input$72860%
Ungecachter Input$28824%
Output$19616%

Selbst bei einem Rabatt von 95% ist der gecachte Input die größte einzelne Position. Das ist die Signatur einer Agenten-Arbeitslast: der günstigste Tokentyp, in riesigem Volumen. Die Summen pro Modell stehen in codex-pro-100-model-mix.csv.

Was den Cache zerstört

Ein Cache-Treffer braucht einen identischen Präfix. Jede Änderung am Anfang des Kontexts zwingt dazu, alles Folgende zum vollen Preis neu zu lesen.

Warum das für deine Codex-Limits wichtig ist

Wenn der Codex-Zähler gecachten Input nahe an seinem API-Preis gewichtet, ist ein Rückgang der Cache-Trefferquote um 1 Punkt teuer. Bei unserem Volumen würde Sol, das von 98.1% auf 90% gecacht wird, etwa $1,004 zusätzlichen Sol-Input kosten, grob 6 weitere Pro-$100-Fenster. Cache-Disziplin ist Kontingent-Disziplin. Was ein Fenster fasst, steht in unserer Messung des Pro-$100-Multiplikators; wie wir in 12 Tagen acht Fenster geschafft haben, steht im Reset-Protokoll.

So haben wir gemessen

Codex schreibt für jede Sitzung ein JSONL-Protokoll unter ~/.codex/sessions/. Jede Anfrage erfasst den kumulierten Input, den gecachten Input und den Output sowie den wöchentlichen Zähler (used_percent) und dessen Zeitpunkt resets_at. Wir haben das Token-Delta jeder Anfrage zum API-Listenpreis des Modells bewertet, auf dem sie lief, und die Anfragen nach wöchentlichem Fenster gruppiert. Die Dollarbeträge sind API-äquivalenter Wert, kein Geld, das wir tatsächlich bezahlt haben.

Quellen

Weiterführend


Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →

Zurück zu finopsllm.com