Gli strumenti server sono una fattura separata
Updated September 1, 2026 · first published September 1, 2026
La maggior parte dei modelli di costo per LLM misura una sola cosa: token di input, token di output e costo per milione. Questo modello era corretto quando le richieste generavano solo testo, ma è diventato obsoleto con l'arrivo degli strumenti lato server.
Web search, fetch e interpreti di codice girano sull'infrastruttura del provider e spesso addebitano una tariffa a chiamata oltre ai token generati. Un singolo turno di un agente può quindi fatturare due volte: una per la ricerca eseguita e una per i token che quel risultato aggiunge al contesto.
L'effetto cumulativo del contesto
Il secondo addebito è quello più insidioso. Ogni risultato di un tool viene aggiunto alla conversazione e ogni turno successivo lo reinvia per intero come input. Dieci ricerche all'inizio di una lunga sessione significano dieci tariffe di ricerca più i relativi payload di token riletti a ogni turno successivo.
Tre controlli operativi
Limitare il numero di chiamate ai tool per sessione, troncare e riassumere i contenuti prima di inserirli nel contesto, e memorizzare nella cache il prefisso stabile del prompt.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →