Il 98% dell'input di Codex era in cache. Senza cache la bolletta è 12 volte più alta
Aggiornato October 9, 2026 · pubblicato inizialmente October 9, 2026
In 12 giorni di uso intensivo di Codex su ChatGPT Pro $100 abbiamo inviato 13.0 miliardi di token di input e ricevuto indietro 47 milioni di token di output. Il 97.6% di quell'input è stato un cache hit. Ai prezzi API di OpenAI il lavoro è costato 1.211 $. Prezzando gli stessi token senza alcun cache hit si arriva a 14.198 $, 12 volte di più.
- Rapporto input/output: circa 279 token di input per ogni token di output.
- Quota dell'input in cache sulla bolletta: 60%, anche con uno sconto del 95%.
- Quota dell'output sulla bolletta: 16%.
Perché i coding agent sono quasi tutti input in cache
Un ciclo agentico reinvia l'intera conversazione a ogni passo: system prompt, definizioni degli strumenti, i file letti, ogni risultato di strumento precedente. Ogni passo aggiunge un po' e rilegge tutto. Quindi l'input cresce con il quadrato della durata della sessione, mentre l'output resta piccolo. In 12 giorni questo ci ha dato un rapporto input/output di 279:1.
A rendere tutto sostenibile è il prompt caching. Sull'API di OpenAI l'input in cache costa un decimo o meno dell'input normale. GPT-6 Sol, che ha fatto la maggior parte del nostro lavoro, costa 2 $ per milione di token di input e 0.10 $ per milione in cache.
Dove sono finiti i soldi
| Modello | Token di input | In cache | Token di output | Valore API | Se non in cache |
|---|---|---|---|---|---|
| Sol | 6.56 mld | 98.1% | 17.5 mln | 1.073 $ | 13.299 $ |
| Luna | 6.41 mld | 97.2% | 29.0 mln | 95 $ | 655 $ |
| GPT-5.5 | 0.03 mld | 93.5% | 0.2 mln | 27 $ | 144 $ |
| Astra | 0.01 mld | 94.5% | 0.0 mln | 16 $ | 99 $ |
| Totale | 13.01 mld | 97.6% | 47 mln | 1.211 $ | 14.198 $ |
| Componente di costo | Valore API | Quota |
|---|---|---|
| Input in cache | 728 $ | 60% |
| Input non in cache | 288 $ | 24% |
| Output | 196 $ | 16% |
Anche con uno sconto del 95%, l'input in cache è la voce più grande della bolletta. È la firma di un carico di lavoro agentico: il tipo di token più economico, in volume enorme. I totali per modello sono in codex-pro-100-model-mix.csv.
Cosa rompe la cache
Un cache hit richiede un prefisso identico. Qualsiasi cosa cambi l'inizio del contesto obbliga a rileggere a prezzo pieno tutto ciò che segue.
- Cambiare modello a metà sessione. Il nuovo modello non ha cache per il tuo contesto.
- Modificare istruzioni o liste di strumenti durante la sessione. Stanno in cima al prompt, quindi tutto quello che sta sotto viene riletto.
- Pause lunghe. Le cache scadono. Tornare dopo una pausa rilegge la sessione a prezzo pieno.
- Compattazione. Riassumere la cronologia riscrive il prefisso. Fa risparmiare token dopo, ma costa un passaggio non in cache adesso.
Perché questo conta per i tuoi limiti di Codex
Se l'indicatore di Codex pesa l'input in cache vicino al suo prezzo API, un calo di 1 punto nel tasso di cache hit costa caro. Al nostro volume, se Sol passasse dal 98.1% al 90% in cache, si aggiungerebbero circa 1.004 $ di solo input di Sol, cioè circa 6 finestre extra di Pro $100. La disciplina sulla cache è disciplina sulla quota. Per cosa contiene una finestra, vedi la nostra misurazione del moltiplicatore di Pro $100; per come abbiamo ottenuto otto finestre in 12 giorni, vedi il registro dei reset.
Come l'abbiamo misurato
Codex scrive un log JSONL di ogni sessione in ~/.codex/sessions/. Ogni richiesta registra i token cumulativi di input, input in cache e output, oltre all'indicatore settimanale (used_percent) e al suo orario resets_at. Abbiamo prezzato il delta di token di ogni richiesta al prezzo di listino API del modello su cui girava e raggruppato le richieste per finestra settimanale. Le cifre in dollari sono valore equivalente API, non soldi che abbiamo pagato.
Fonti
Correlati
- ChatGPT Pro 100 $ vale davvero 2.6x Plus
- 8 finestre settimanali di Codex in 12 giorni
- I reset di Codex hanno trasformato 40 $ in 1.211 $
- Quanto include Codex in ChatGPT Pro
- Claude Max 20x contro ChatGPT Pro
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →