98% van onze Codex-input-tokens was gecachet. Zonder caching is de rekening 12x groter
Bijgewerkt October 9, 2026 · eerst gepubliceerd October 9, 2026
In 12 dagen zwaar Codex-gebruik op ChatGPT Pro $100 stuurden we 13.0 miljard input-tokens en kregen we 47 miljoen output-tokens terug. 97.6% van die input was een cachetreffer. Tegen OpenAI API-prijzen kwam het werk op $1,211. Reken je dezelfde tokens zonder cachetreffers door, dan is het $14,198, 12 keer meer.
- Verhouding input tot output: ongeveer 279 input-tokens per output-token.
- Aandeel gecachete input in de rekening: 60%, zelfs met 95% korting.
- Aandeel output in de rekening: 16%.
Waarom codeeragents bijna alleen gecachete input hebben
Een agentlus stuurt bij elke stap het hele gesprek opnieuw mee: systeemprompt, tooldefinities, de bestanden die hij heeft gelezen, elk eerder toolresultaat. Elke stap voegt een beetje toe en leest alles opnieuw. Input groeit dus kwadratisch met de sessielengte terwijl output klein blijft. Over 12 dagen gaf dat een verhouding van 279:1 tussen input en output.
Prompt caching houdt dit betaalbaar. Gecachete input kost op de API van OpenAI een tiende of minder van normale input. GPT-6 Sol, waarmee we het meeste werk deden, rekent $2 per miljoen input-tokens en $0.10 per miljoen gecachet.
Waar het geld naartoe ging
| Model | Input-tokens | Gecachet | Output-tokens | API-waarde | Zonder cache |
|---|---|---|---|---|---|
| Sol | 6.56B | 98.1% | 17.5M | $1,073 | $13,299 |
| Luna | 6.41B | 97.2% | 29.0M | $95 | $655 |
| GPT-5.5 | 0.03B | 93.5% | 0.2M | $27 | $144 |
| Astra | 0.01B | 94.5% | 0.0M | $16 | $99 |
| Totaal | 13.01B | 97.6% | 47M | $1,211 | $14,198 |
| Kostencomponent | API-waarde | Aandeel |
|---|---|---|
| Gecachete input | $728 | 60% |
| Ongecachete input | $288 | 24% |
| Output | $196 | 16% |
Zelfs met 95% korting is gecachete input de grootste afzonderlijke post. Dat is het kenmerk van een agentworkload: het goedkoopste tokentype in enorme volumes. De totalen per model staan in codex-pro-100-model-mix.csv.
Wat de cache breekt
Een cachetreffer vraagt om een identieke prefix. Alles wat het begin van de context wijzigt, dwingt een herlezing van alles daarna tegen de volle prijs af.
- Halverwege een sessie van model wisselen. Het nieuwe model heeft geen cache voor jouw context.
- Instructies of toollijsten midden in de sessie aanpassen. Ze staan bovenaan de prompt, dus alles eronder wordt opnieuw gelezen.
- Lange pauzes. Caches verlopen. Na een pauze wordt de sessie tegen de volle prijs opnieuw gelezen.
- Compactie. De geschiedenis samenvatten herschrijft de prefix. Het bespaart later tokens, maar kost nu één ongecachete ronde.
Waarom dit telt voor je Codex-limieten
Als de Codex-meter gecachete input ook maar in de buurt van de API-prijs weegt, is een daling van 1 punt in je cachetreffer-ratio duur. Bij ons volume zou Sol dat van 98.1% naar 90% gecachet gaat alleen al ongeveer $1,004 aan Sol-input toevoegen, zo'n 6 extra Pro $100-vensters. Cachediscipline is quotadiscipline. Wat een venster bevat, lees je in onze meting van de Pro $100-multiplier; hoe we acht vensters in 12 dagen kregen, staat in het resetlogboek.
Hoe we het hebben gemeten
Codex schrijft van elke sessie een JSONL-log onder ~/.codex/sessions/. Elk verzoek legt cumulatieve input, gecachete input en output-tokens vast, plus de weekmeter (used_percent) en de resets_at-tijd. We hebben het tokendelta van elk verzoek geprijsd tegen de API-listprijs van het model waarop het draaide en de verzoeken gegroepeerd per weekvenster. De dollarbedragen zijn API-equivalente waarde, geen geld dat we hebben betaald.
Bronnen
Gerelateerd
- ChatGPT Pro $100 is in werkelijkheid 2.6x Plus
- 8 wekelijkse Codex-vensters in 12 dagen
- Codex-resets veranderden $40 in $1,211
- Hoeveel Codex ChatGPT Pro bevat
- Claude Max 20x vs ChatGPT Pro
Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →