Quick answer: Le budget de raisonnement était un nombre que vous fixiez. Vous passiez budget_tokens: N, et N servait à la fois de contrôle et de prévision : au pire, chaque requête coûtait N tokens de...

Réflexion adaptative et prévision des coûts

Updated September 1, 2026 · first published September 1, 2026

Le budget de raisonnement était un nombre que vous fixiez. Vous passiez budget_tokens: N, et N servait à la fois de contrôle et de prévision : au pire, chaque requête coûtait N tokens de raisonnement.

Ce paramètre est déprécié sur Opus 4.6 et Sonnet 4.6, et sur les modèles les plus récents — Fable 5 et 5.1, Sonnet 5, Opus 5, 4.8 et 4.7 — l’envoyer renvoie une 400. Il est remplacé par thinking: {type: "adaptive"} : le modèle décide de l’effort selon la difficulté.

Ce qui change dans les chiffres

Le coût moyen par requête baisse généralement, car les requêtes faciles cessent de payer un raisonnement inutile. La variance augmente, car les requêtes difficiles ne sont plus tronquées à votre plafond. Un budget exprimé en maximum par requête n’a plus de prise.

Prévoyez la distribution, pas le plafond

Suivez les tokens de raisonnement comme série distincte : ils figurent déjà dans l’objet d’usage de chaque réponse.

Budgétez par centiles : un p50 et un p99 par route plutôt qu’un « N tokens par requête ».

Alertez sur le ratio, pas sur le total : la part des tokens de raisonnement dans le total bouge en premier quand un changement de prompt fait travailler le modèle davantage.

Où un plafond reste pertinent

Les limites de dépense par route et par locataire fonctionnent toujours et attrapent toujours les boucles emballées. C’est là que doit vivre le garde-fou : à la frontière que vous maîtrisez.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research