Vai al contenuto

Pagare due volte la finestra di contesto

Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026

Risposta rapida: Una finestra di contesto viene pubblicizzata come capacità: 200.000 token, un milione, spazio per ciò che serve. La capacità però non è l'unità di fatturazione. Ti viene addebitato ciò che invii, e in...

Una finestra di contesto viene pubblicizzata come capacità: 200.000 token, un milione, spazio per ciò che serve. La capacità però non è l'unità di fatturazione. Ti viene addebitato ciò che invii, e in una conversazione a più turni invii di nuovo quasi tutto a ogni singolo turno.

Questo è il secondo pagamento. Un documento di 30.000 token caricato all'inizio di una conversazione di venti turni non equivale a 30.000 token di input: ne vale circa 600.000, perché il turno due lo reinvia, e così anche il turno venti.

Il calcolo che nessuno fa

Il costo cresce con il quadrato della lunghezza della conversazione, non linearmente. Raddoppiare il numero di turni moltiplica per circa quattro i token di input, supponendo che il contesto continui ad accumularsi. I team che modellano il "costo per messaggio" e lo moltiplicano per il numero di messaggi sottostimano gravemente le sessioni lunghe, e l'errore cresce proprio con gli utenti che vorresti trattenere.

Spesso c'è anche un terzo addebito: molti provider applicano una tariffa maggiorata alle richieste che superano una soglia di contesto lungo. Un solo allegato in più può far superare quella soglia e riprezzare l'intera chiamata, input e output compresi, non solo i token che l'hanno superata.

Cosa misurare

Tieni traccia dell'utilizzo del contesto: token inviati rispetto ai token che il modello ha effettivamente richiesto. È la cosa più vicina a una metrica di spreco in questo ambito. Tieni traccia dei token di input per conversazione, non per richiesta, e osserva il p99: lì si trovano le sessioni che costano venti volte la mediana.

Imposta un avviso sulle richieste che superano la soglia di prezzo del contesto lungo. È un salto a gradino, non un gradiente, e non si noterà in alcun totale giornaliero.

Tre correzioni, dalla più economica

Metti in cache il prefisso stabile. Se il system prompt e i documenti caricati non cambiano durante una conversazione, il prompt caching trasforma il costo ripetuto in una frazione di sé. È il cambiamento con il ritorno più alto per qualsiasi prodotto multi-turno.

Riduci la cronologia in modo deliberato. I turni più vecchi raramente giustificano il prezzo della loro ripetizione. Riassumi la parte iniziale di una conversazione lunga e scarta i turni grezzi: mantieni il filo e smetti di pagare per intero.

Invia l'estratto, non il corpus. Il retrieval esiste proprio per questo. Il fatto che la finestra sia abbastanza grande da contenere un intero documento non è un motivo per inserirvelo interamente.

Correlati

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com