Vai al contenuto

Il 98% dell'input di Codex era in cache. Senza cache la bolletta è 12 volte più alta

Aggiornato October 9, 2026 · pubblicato inizialmente October 9, 2026

Risposta rapida: In 12 giorni di uso intensivo di Codex su ChatGPT Pro $100 abbiamo inviato 13.0 miliardi di token di input e ricevuto indietro 47 milioni di token di output. Il 97.6% di quell'input è stato un cache...

In 12 giorni di uso intensivo di Codex su ChatGPT Pro $100 abbiamo inviato 13.0 miliardi di token di input e ricevuto indietro 47 milioni di token di output. Il 97.6% di quell'input è stato un cache hit. Ai prezzi API di OpenAI il lavoro è costato 1.211 $. Prezzando gli stessi token senza alcun cache hit si arriva a 14.198 $, 12 volte di più.

Valore API di 12 giorni di Codex per modello: con cache e senza$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraArancione: cosa abbiamo pagato in termini API, con cacheBlu: gli stessi token senza cache hit
Valore API di 12 giorni di Codex per modello: con cache e senza

Perché i coding agent sono quasi tutti input in cache

Un ciclo agentico reinvia l'intera conversazione a ogni passo: system prompt, definizioni degli strumenti, i file letti, ogni risultato di strumento precedente. Ogni passo aggiunge un po' e rilegge tutto. Quindi l'input cresce con il quadrato della durata della sessione, mentre l'output resta piccolo. In 12 giorni questo ci ha dato un rapporto input/output di 279:1.

A rendere tutto sostenibile è il prompt caching. Sull'API di OpenAI l'input in cache costa un decimo o meno dell'input normale. GPT-6 Sol, che ha fatto la maggior parte del nostro lavoro, costa 2 $ per milione di token di input e 0.10 $ per milione in cache.

Dove sono finiti i soldi

ModelloToken di inputIn cacheToken di outputValore APISe non in cache
Sol6.56 mld98.1%17.5 mln1.073 $13.299 $
Luna6.41 mld97.2%29.0 mln95 $655 $
GPT-5.50.03 mld93.5%0.2 mln27 $144 $
Astra0.01 mld94.5%0.0 mln16 $99 $
Totale13.01 mld97.6%47 mln1.211 $14.198 $
Componente di costoValore APIQuota
Input in cache728 $60%
Input non in cache288 $24%
Output196 $16%

Anche con uno sconto del 95%, l'input in cache è la voce più grande della bolletta. È la firma di un carico di lavoro agentico: il tipo di token più economico, in volume enorme. I totali per modello sono in codex-pro-100-model-mix.csv.

Cosa rompe la cache

Un cache hit richiede un prefisso identico. Qualsiasi cosa cambi l'inizio del contesto obbliga a rileggere a prezzo pieno tutto ciò che segue.

Perché questo conta per i tuoi limiti di Codex

Se l'indicatore di Codex pesa l'input in cache vicino al suo prezzo API, un calo di 1 punto nel tasso di cache hit costa caro. Al nostro volume, se Sol passasse dal 98.1% al 90% in cache, si aggiungerebbero circa 1.004 $ di solo input di Sol, cioè circa 6 finestre extra di Pro $100. La disciplina sulla cache è disciplina sulla quota. Per cosa contiene una finestra, vedi la nostra misurazione del moltiplicatore di Pro $100; per come abbiamo ottenuto otto finestre in 12 giorni, vedi il registro dei reset.

Come l'abbiamo misurato

Codex scrive un log JSONL di ogni sessione in ~/.codex/sessions/. Ogni richiesta registra i token cumulativi di input, input in cache e output, oltre all'indicatore settimanale (used_percent) e al suo orario resets_at. Abbiamo prezzato il delta di token di ogni richiesta al prezzo di listino API del modello su cui girava e raggruppato le richieste per finestra settimanale. Le cifre in dollari sono valore equivalente API, non soldi che abbiamo pagato.

Fonti

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com