Vai al contenuto

Trovare il cache miss dietro la fattura OpenAI

Aggiornato September 26, 2026 · pubblicato inizialmente September 26, 2026

Risposta rapida: Un dashboard della cache dei prompt può dirvi che il riutilizzo è calato. Da solo non può dirvi quale modifica alla richiesta ha causato il calo né quanto sia costato. Il rilascio dell'8 settembre...

Un dashboard della cache dei prompt può dirvi che il riutilizzo è calato. Da solo non può dirvi quale modifica alla richiesta ha causato il calo né quanto sia costato. Il rilascio dell'8 settembre 2026 di OpenAI ha reso Prompt Cache Diagnostics disponibile in generale nella Responses API per GPT-5.6 e per i modelli supportati successivi. La mossa utile per il FinOps è trasformare un calo dei token in cache in un'indagine breve e ripetibile.

Confrontate la richiesta che ha mancato la cache

Salvate l'ID di una risposta recente e completata il cui prefisso vi aspettavate di riutilizzare. Nella richiesta successiva confrontabile alla Responses API, della stessa organizzazione, impostate prompt_cache_options.comparison_response_id su quell'ID. Poi leggete prompt_cache_diagnostics nella nuova risposta, insieme a usage.input_tokens_details.cached_tokens. L'opzione di confronto richiede una diagnosi: non carica la conversazione precedente né modifica il comportamento della cache. La guida alle diagnostiche di OpenAI include esempi di richieste funzionanti.

const next = await client.responses.create({
  model: model,
  instructions: stableInstructions,
  input: nextInput,
  tools: stableTools,
  prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);

Lo snippet presuppone che baseline sia una risposta recente e completata e che le altre variabili siano i dati della vostra richiesta. Mantenete un prefisso stabile abbastanza lungo da essere messo in cache: OpenAI documenta un minimo di 1,024 token per GPT-5.6 e successivi. Un prompt piccolo o radicalmente diverso non è un test significativo di cache miss.

Correggete la causa, non la metrica

Un risultato cache_miss può indicare un cambio di modello, di service tier, di definizioni o ordine degli strumenti, di chiave di cache, di formato di risposta, di sforzo di ragionamento, di verbosità o di contesto compattato. Per esempio, la rinomina di uno schema di strumento, apparentemente innocua, può invalidare il prefisso riutilizzabile. Confrontate la configurazione della richiesta e i primi byte del prompt, ripristinate la stabilità dove il cambiamento era accidentale e rieseguite il confronto contro la stessa baseline. OpenAI riporta la prima causa che trova, quindi dopo la prima correzione potrebbe emergerne un'altra.

Non forzate un hit se il cambiamento era deliberato. Un modello diverso può ridurre il costo totale dell'attività anche perdendo il riutilizzo della cache; la compattazione può ridurre il contesto futuro. Giudicate l'intera richiesta e l'attività, non la percentuale di cache hit isolatamente. Una baseline scaduta o un risultato unavailable sono non conclusivi, non una prova che la cache abbia fallito.

Traducete il risultato in denaro

cache_missed_tokens stima i token riutilizzabili persi rispetto alla risposta di confronto. Non è un conteggio di token fatturati. Anche un risultato cache_hit non dimostra un risparmio in dollari. Per il costo di input effettivo, raccogliete per ogni risposta il totale di input_tokens, cached_tokens e cache_write_tokens, poi applicate la tariffa corrente per quel modello e quel livello di elaborazione. Per GPT-5.6 e successivi, la guida al prompt caching di OpenAI indica che le letture dalla cache costano 0.1 volte la tariffa di input non in cache e le scritture in cache costano 1.25 volte quella tariffa.

ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000

Sono categorie di token esclusive: non aggiungete una sovrattassa di scrittura in cache a token già contati alla tariffa di scrittura. Questa formula copre solo l'input; includete output, strumenti, tentativi e altri addebiti quando calcolate il costo per attività riuscita. Usate il listino prezzi corrente del fornitore invece di un prezzo fisso riportato in questo articolo.

Un controllo settimanale utile

  1. Raggruppate il traffico comparabile per carico di lavoro, modello e livello di servizio; rappresentate graficamente la quota di token in cache e il costo di input per attività completata.
  2. Campionate una regressione improvvisa, confrontatela con una baseline recente e registrate il motivo della diagnosi e la modifica di codice responsabile.
  3. Correggete la deriva accidentale di prefisso o configurazione; mantenete le modifiche intenzionali di qualità o instradamento se migliora l'economia complessiva dell'attività.
  4. Validate il risultato su traffico di produzione rappresentativo e riconciliate il risparmio osservato con la fatturazione.

Le diagnostiche in sé non hanno un costo funzionale aggiuntivo, ma le richieste di test extra vengono fatturate normalmente. Il vantaggio non è un grafico del tasso di hit più bello. È una spiegazione difendibile del perché il costo di input di un particolare carico di lavoro è cambiato, e se la correzione proposta ha davvero ridotto la fattura.

Domande che si pongono i team

Una diagnosi di cache hit dimostra che una richiesta è costata meno?

No. Indica che non è stato rilevato alcun miss rispetto alla baseline selezionata. Verificate i cached_tokens effettivi e le categorie di token tariffate della richiesta prima di dichiarare un risparmio.

Le diagnostiche possono confrontare due richieste OpenAI qualsiasi?

No. Usate una baseline recente e completata della stessa organizzazione, e aspettatevi questo flusso solo sui modelli supportati della Responses API da GPT-5.6 in poi. Un record di confronto può scadere.

Ogni cache miss va eliminato?

No. Un cambio di modello, un diverso service tier o un contesto compattato possono essere intenzionali. Confrontate qualità, latenza e costo per attività riuscita prima di invertire la modifica.

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com