Ga naar inhoud

98% van onze Codex-input-tokens was gecachet. Zonder caching is de rekening 12x groter

Bijgewerkt October 9, 2026 · eerst gepubliceerd October 9, 2026

Kort antwoord: In 12 dagen zwaar Codex-gebruik op ChatGPT Pro $100 stuurden we 13.0 miljard input-tokens en kregen we 47 miljoen output-tokens terug. 97.6% van die input was een cachetreffer. Tegen OpenAI...

In 12 dagen zwaar Codex-gebruik op ChatGPT Pro $100 stuurden we 13.0 miljard input-tokens en kregen we 47 miljoen output-tokens terug. 97.6% van die input was een cachetreffer. Tegen OpenAI API-prijzen kwam het werk op $1,211. Reken je dezelfde tokens zonder cachetreffers door, dan is het $14,198, 12 keer meer.

API-waarde van 12 dagen Codex per model: gecachet vs ongecachet$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraOranje: wat we in API-termen betaalden, met cachingBlauw: dezelfde tokens zonder cachetreffers
API-waarde van 12 dagen Codex per model: gecachet vs ongecachet

Waarom codeeragents bijna alleen gecachete input hebben

Een agentlus stuurt bij elke stap het hele gesprek opnieuw mee: systeemprompt, tooldefinities, de bestanden die hij heeft gelezen, elk eerder toolresultaat. Elke stap voegt een beetje toe en leest alles opnieuw. Input groeit dus kwadratisch met de sessielengte terwijl output klein blijft. Over 12 dagen gaf dat een verhouding van 279:1 tussen input en output.

Prompt caching houdt dit betaalbaar. Gecachete input kost op de API van OpenAI een tiende of minder van normale input. GPT-6 Sol, waarmee we het meeste werk deden, rekent $2 per miljoen input-tokens en $0.10 per miljoen gecachet.

Waar het geld naartoe ging

ModelInput-tokensGecachetOutput-tokensAPI-waardeZonder cache
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Totaal13.01B97.6%47M$1,211$14,198
KostencomponentAPI-waardeAandeel
Gecachete input$72860%
Ongecachete input$28824%
Output$19616%

Zelfs met 95% korting is gecachete input de grootste afzonderlijke post. Dat is het kenmerk van een agentworkload: het goedkoopste tokentype in enorme volumes. De totalen per model staan in codex-pro-100-model-mix.csv.

Wat de cache breekt

Een cachetreffer vraagt om een identieke prefix. Alles wat het begin van de context wijzigt, dwingt een herlezing van alles daarna tegen de volle prijs af.

Waarom dit telt voor je Codex-limieten

Als de Codex-meter gecachete input ook maar in de buurt van de API-prijs weegt, is een daling van 1 punt in je cachetreffer-ratio duur. Bij ons volume zou Sol dat van 98.1% naar 90% gecachet gaat alleen al ongeveer $1,004 aan Sol-input toevoegen, zo'n 6 extra Pro $100-vensters. Cachediscipline is quotadiscipline. Wat een venster bevat, lees je in onze meting van de Pro $100-multiplier; hoe we acht vensters in 12 dagen kregen, staat in het resetlogboek.

Hoe we het hebben gemeten

Codex schrijft van elke sessie een JSONL-log onder ~/.codex/sessions/. Elk verzoek legt cumulatieve input, gecachete input en output-tokens vast, plus de weekmeter (used_percent) en de resets_at-tijd. We hebben het tokendelta van elk verzoek geprijsd tegen de API-listprijs van het model waarop het draaide en de verzoeken gegroepeerd per weekvenster. De dollarbedragen zijn API-equivalente waarde, geen geld dat we hebben betaald.

Bronnen

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com