Quick answer: O orçamento de raciocínio era um número definido por si. Passava budget_tokens: N e N servia de controlo e de previsão: no pior caso, cada pedido custava N tokens de raciocínio.Esse parâmetro está...

Pensamento adaptativo e previsão de custos

Updated September 1, 2026 · first published September 1, 2026

O orçamento de raciocínio era um número definido por si. Passava budget_tokens: N e N servia de controlo e de previsão: no pior caso, cada pedido custava N tokens de raciocínio.

Esse parâmetro está descontinuado no Opus 4.6 e no Sonnet 4.6 e, nos modelos mais recentes — Fable 5 e 5.1, Sonnet 5, Opus 5, 4.8 e 4.7 — enviá-lo devolve um 400. É substituído por thinking: {type: "adaptive"}: o modelo decide quanto pensar consoante a dificuldade.

O que muda nos números

O custo médio por pedido costuma descer, porque os pedidos fáceis deixam de pagar raciocínio de que não precisavam. A variância sobe, porque os difíceis já não são truncados no seu tecto. Um orçamento expresso como máximo por pedido fica sem apoio.

Preveja a distribuição, não o tecto

Acompanhe os tokens de raciocínio como série própria — já vêm no objeto de utilização de cada resposta.

Orçamente por percentis: um p50 e um p99 por rota em vez de "N tokens por pedido".

Alerte sobre a proporção, não o total: a quota de tokens de raciocínio é o primeiro número a mexer quando uma alteração de prompt faz o modelo trabalhar mais.

Onde ainda cabe um limite

Os limites de despesa por rota e por inquilino continuam a funcionar e continuam a apanhar ciclos descontrolados. É aí que vive agora a proteção: na fronteira que controla.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research