Pensiero adattivo e previsione dei costi
Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026
Il budget di ragionamento era un numero che fissavi tu. Passavi thinking: {type: "enabled", budget_tokens: N} e N era insieme controllo e previsione: nel caso peggiore, ogni richiesta ti costava N token di ragionamento, e la finanza poteva moltiplicare.
Quel parametro è deprecato su Opus 4.6 e Sonnet 4.6, e sui modelli più recenti — Fable 5 e 5.1, Sonnet 5, Opus 5, 4.8 e 4.7 — inviarlo restituisce un 400. Il sostituto è thinking: {type: "adaptive"}, con cui è il modello a decidere quanto ragionare in base alla difficoltà della richiesta.
In media è un output migliore per dollaro. Ma è anche la rimozione di un tetto: se la tua previsione era costruita su quel tetto, ora è sbagliata in un modo che non emerge finché il mese non si chiude.
Cosa cambia nei numeri
Il costo medio per richiesta di solito scende, perché le richieste facili smettono di pagare un ragionamento che non serviva. La varianza sale, perché le richieste difficili non vengono più troncate al tuo limite. I due movimenti vanno in direzioni opposte, e un budget espresso come massimo per richiesta non ha più nulla a cui agganciarsi.
Il problema pratico non è la media, è la coda: una modifica al prompt, un nuovo tipo di documento o un utente che fa domande più difficili spostano una fetta del traffico verso un ragionamento più profondo, e nulla nella tua configurazione lo limita.
Prevedi la distribuzione, non il tetto
Tre cambiamenti, in ordine di valore.
Traccia i token di ragionamento come serie a sé. Sono già nell'oggetto di utilizzo di ogni risposta. Separali da input e output nella telemetria e vedrai lo spostamento il giorno stesso in cui avviene, non a fine mese.
Fai il budget sui percentili. Sostituisci "N token per richiesta" con un p50 e un p99 per rotta. Il p50 ti dice quanto costa il carico di lavoro; la distanza tra p50 e p99 ti dice quanto sei esposto a una settimana storta.
Allerta sul rapporto, non sul totale. I token di ragionamento come quota dei token totali per rotta sono il numero che si muove per primo quando una modifica al prompt fa lavorare di più il modello. Un allarme sulla spesa totale scatta giorni dopo, quando il volume si è già accumulato.
Dove serve ancora un tetto
Eliminare la manopola per richiesta non significa eliminare ogni limite. I limiti di spesa a livello di rotta e di tenant funzionano ancora, intercettano i cicli fuori controllo e ora sono il posto giusto per il guardrail: al confine che controlli tu, non dentro un parametro di richiesta che non esiste più. Sui percorsi sensibili alla latenza, dove un ragionamento profondo non vale mai la pena, la leva è la scelta del modello, non un budget di token.
Correlati
- Attribuzione dei token di ragionamento
- Guida ai costi dei modelli di ragionamento
- Governance del budget LLM
Correlati
- Attribuzione dei token di ragionamento
- Guida ai costi dei modelli di ragionamento
- Governance del budget LLM
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →