98% unserer Codex-Input-Tokens waren gecacht. Ohne Caching wäre die Rechnung 12-mal so hoch
Aktualisiert October 9, 2026 · erstveröffentlicht October 9, 2026
In 12 Tagen intensiver Codex-Nutzung mit ChatGPT Pro $100 haben wir 13.0 Milliarden Input-Tokens gesendet und 47 Millionen Output-Tokens zurückbekommen. 97.6% dieses Inputs waren Cache-Treffer. Zu den API-Preisen von OpenAI kam die Arbeit auf $1,211. Mit denselben Tokens ohne jeden Cache-Treffer wären es $14,198, also 12-mal mehr.
- Verhältnis Input zu Output: etwa 279 Input-Tokens für jeden Output-Token.
- Anteil des gecachten Inputs an der Rechnung: 60%, selbst bei einem Rabatt von 95%.
- Anteil des Outputs an der Rechnung: 16%.
Warum Coding-Agenten fast nur gecachten Input verbrauchen
Eine Agentenschleife sendet bei jedem Schritt die gesamte Konversation erneut: den System-Prompt, die Tool-Definitionen, die gelesenen Dateien und jedes frühere Tool-Ergebnis. Jeder Schritt fügt ein wenig hinzu und liest alles erneut. Der Input wächst daher mit dem Quadrat der Sitzungslänge, während der Output klein bleibt. Über 12 Tage ergab das ein Verhältnis von Input zu Output von 279:1.
Prompt-Caching hält das bezahlbar. Gecachter Input kostet bei der OpenAI-API ein Zehntel oder weniger des normalen Inputs. GPT-6 Sol, das den größten Teil unserer Arbeit erledigt hat, berechnet $2 pro Million Input-Tokens und $0.10 pro Million gecachter Tokens.
Wohin das Geld floss
| Modell | Input-Tokens | Gecacht | Output-Tokens | API-Wert | Ohne Cache |
|---|---|---|---|---|---|
| Sol | 6.56B | 98.1% | 17.5M | $1,073 | $13,299 |
| Luna | 6.41B | 97.2% | 29.0M | $95 | $655 |
| GPT-5.5 | 0.03B | 93.5% | 0.2M | $27 | $144 |
| Astra | 0.01B | 94.5% | 0.0M | $16 | $99 |
| Total | 13.01B | 97.6% | 47M | $1,211 | $14,198 |
| Kostenbestandteil | API-Wert | Anteil |
|---|---|---|
| Gecachter Input | $728 | 60% |
| Ungecachter Input | $288 | 24% |
| Output | $196 | 16% |
Selbst bei einem Rabatt von 95% ist der gecachte Input die größte einzelne Position. Das ist die Signatur einer Agenten-Arbeitslast: der günstigste Tokentyp, in riesigem Volumen. Die Summen pro Modell stehen in codex-pro-100-model-mix.csv.
Was den Cache zerstört
Ein Cache-Treffer braucht einen identischen Präfix. Jede Änderung am Anfang des Kontexts zwingt dazu, alles Folgende zum vollen Preis neu zu lesen.
- Modellwechsel mitten in der Sitzung. Das neue Modell hat keinen Cache für deinen Kontext.
- Änderungen an Anweisungen oder Tool-Listen mitten in der Sitzung. Sie stehen ganz oben im Prompt, daher wird alles darunter neu gelesen.
- Lange Pausen. Caches laufen ab. Wer nach einer Pause zurückkehrt, liest die Sitzung zum vollen Preis neu ein.
- Compaction. Das Zusammenfassen des Verlaufs schreibt den Präfix neu. Das spart später Tokens, kostet jetzt aber einen Durchlauf ohne Cache.
Warum das für deine Codex-Limits wichtig ist
Wenn der Codex-Zähler gecachten Input nahe an seinem API-Preis gewichtet, ist ein Rückgang der Cache-Trefferquote um 1 Punkt teuer. Bei unserem Volumen würde Sol, das von 98.1% auf 90% gecacht wird, etwa $1,004 zusätzlichen Sol-Input kosten, grob 6 weitere Pro-$100-Fenster. Cache-Disziplin ist Kontingent-Disziplin. Was ein Fenster fasst, steht in unserer Messung des Pro-$100-Multiplikators; wie wir in 12 Tagen acht Fenster geschafft haben, steht im Reset-Protokoll.
So haben wir gemessen
Codex schreibt für jede Sitzung ein JSONL-Protokoll unter ~/.codex/sessions/. Jede Anfrage erfasst den kumulierten Input, den gecachten Input und den Output sowie den wöchentlichen Zähler (used_percent) und dessen Zeitpunkt resets_at. Wir haben das Token-Delta jeder Anfrage zum API-Listenpreis des Modells bewertet, auf dem sie lief, und die Anfragen nach wöchentlichem Fenster gruppiert. Die Dollarbeträge sind API-äquivalenter Wert, kein Geld, das wir tatsächlich bezahlt haben.
Quellen
Weiterführend
- ChatGPT Pro $100 ist in Wahrheit 2.6x Plus
- 8 Codex-Wochenfenster in 12 Tagen
- Codex-Resets machten aus $40 einen Wert von $1,211
- Was ChatGPT Pro an Codex enthält
- Claude Max 20x vs. ChatGPT Pro
Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →