Réflexion adaptative et prévision des coûts
Updated September 1, 2026 · first published September 1, 2026
Le budget de raisonnement était un nombre que vous fixiez. Vous passiez budget_tokens: N, et N servait à la fois de contrôle et de prévision : au pire, chaque requête coûtait N tokens de raisonnement.
Ce paramètre est déprécié sur Opus 4.6 et Sonnet 4.6, et sur les modèles les plus récents — Fable 5 et 5.1, Sonnet 5, Opus 5, 4.8 et 4.7 — l’envoyer renvoie une 400. Il est remplacé par thinking: {type: "adaptive"} : le modèle décide de l’effort selon la difficulté.
Ce qui change dans les chiffres
Le coût moyen par requête baisse généralement, car les requêtes faciles cessent de payer un raisonnement inutile. La variance augmente, car les requêtes difficiles ne sont plus tronquées à votre plafond. Un budget exprimé en maximum par requête n’a plus de prise.
Prévoyez la distribution, pas le plafond
Suivez les tokens de raisonnement comme série distincte : ils figurent déjà dans l’objet d’usage de chaque réponse.
Budgétez par centiles : un p50 et un p99 par route plutôt qu’un « N tokens par requête ».
Alertez sur le ratio, pas sur le total : la part des tokens de raisonnement dans le total bouge en premier quand un changement de prompt fait travailler le modèle davantage.
Où un plafond reste pertinent
Les limites de dépense par route et par locataire fonctionnent toujours et attrapent toujours les boucles emballées. C’est là que doit vivre le garde-fou : à la frontière que vous maîtrisez.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →