Quick answer: El presupuesto de razonamiento era un número que fijabas tú. Pasabas budget_tokens: N y N era control y previsión a la vez: en el peor caso, cada petición costaba N tokens de razonamiento.Ese...

Pensamiento adaptativo y previsión de costes

Updated September 1, 2026 · first published September 1, 2026

El presupuesto de razonamiento era un número que fijabas tú. Pasabas budget_tokens: N y N era control y previsión a la vez: en el peor caso, cada petición costaba N tokens de razonamiento.

Ese parámetro está obsoleto en Opus 4.6 y Sonnet 4.6, y en los modelos más nuevos — Fable 5 y 5.1, Sonnet 5, Opus 5, 4.8 y 4.7 — enviarlo devuelve un 400. Lo sustituye thinking: {type: "adaptive"}: el modelo decide cuánto pensar según la dificultad.

Qué cambia en los números

El coste medio por petición suele bajar, porque las peticiones fáciles dejan de pagar razonamiento que no necesitaban. La varianza sube, porque las difíciles ya no se truncan en tu tope. Un presupuesto expresado como máximo por petición se queda sin nada a lo que agarrarse.

Prevé la distribución, no el tope

Sigue los tokens de razonamiento como serie propia: ya vienen en el objeto de uso de cada respuesta.

Presupuesta por percentiles: un p50 y un p99 por ruta en vez de "N tokens por petición".

Alerta sobre la proporción, no el total: los tokens de razonamiento como porcentaje del total son lo primero que se mueve cuando un cambio de prompt hace trabajar más al modelo.

Dónde sigue cabiendo un límite

Los límites de gasto por ruta y por inquilino siguen funcionando y siguen atrapando bucles descontrolados. Ahí es donde va ahora la barrera: en la frontera que controlas, no en un parámetro que ya no existe.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research