Los niveles de esfuerzo de Opus 5.5 son el precio real

Updated September 22, 2026 · first published September 22, 2026

Claude Opus 5.5 cuesta $4 por millón de tokens de entrada y $20 por millón de tokens de salida. Eso es 20% menos que Opus 5. La tarifa es la mitad menor del costo. La mayor mitad es el parámetro effort, que decide cuántos tokens gasta el modelo pensando antes de responder.

Un modelo, cinco precios

Opus 5.5 expone esfuerzo desde low hasta medium, high, xhigh y max. Cada nivel es el mismo modelo con la misma tarifa por token, pero produce un número muy diferente de tokens. Análisis independiente reportado por The Decoder encontró que cuatro de los cinco niveles se sitúan en la frontera de eficiencia costo-rendimiento. También encontró que a esfuerzo máximo Opus 5.5 usó alrededor de 119.000 tokens de salida por tarea, mucho más que modelos competidores en sus máximos niveles.

A 20 $ por millón, 119.200 tokens de salida son 2,38 $ por tarea antes de contar la entrada. En medium, Artificial Analysis midió 25.700 tokens de salida, es decir, 0,51 $. Contando la entrada, max cuesta 5,98 $ por tarea y medium 1,34 $: el mismo modelo es unas 4,5 veces más caro por tarea según un solo parámetro de la petición.

Medido en el Artificial Analysis Intelligence Index v4.3.2 (diez evaluaciones), consultado el 22 de septiembre de 2026. Todas las filas usan la misma batería de pruebas, así que se comparan directamente.

Modelo y esfuerzoIntelligence IndexCoste por tareaTokens de salida por tareaEn la frontera coste–rendimiento
Opus 5.5 · low42.3$0.5510,200No
Opus 5.5 · medium51.2$1.3425,700
Opus 5.5 · high53.6$1.8235,600
Opus 5.5 · xhigh56.0$3.4665,700
Opus 5.5 · max57.6$5.98119,200
Opus 5 · high (referencia)48.1$3.6146,200No

Fuente: Artificial Analysis. En la frontera significa que ningún ajuste de GPT-6 Sol, GPT-6 Astra, Opus 5, Opus 5.5 o Fable 5.1 puntúa más por menos. Opus 5.5 low queda fuera porque GPT-6 Sol en xhigh puntúa 44,1 por 0,53 $. Pasar de xhigh a max suma 1,6 puntos con un 73 % más de coste.

Medio es la configuración con la que Anthropic hace benchmarks

La comparación principal de Anthropic se hace a esfuerzo predeterminado, que es medio. Dice que Opus 5.5 a medio vence a GPT-6 Astra a máximo esfuerzo en trabajo de conocimiento por aproximadamente un quinto del costo por tarea. Entonces el caso propio de Anthropic para el modelo se construye en medio, y máximo es la excepción. Un equipo que establece máximo en todas partes "para estar seguro" paga por tokens que los benchmarks de lanzamiento no necesitaban.

Cómo establecer esfuerzo sin adivinar

  1. Establece por defecto medio. Hazlo el valor explícito en código, no un defecto del SDK que pueda cambiar bajo ti.
  2. Sube esfuerzo por ruta, no globalmente. La depuración difícil, la planificación de horizonte largo y los pasos de revisión final pueden justificar alto o máximo. La clasificación, extracción y ediciones rutinarias raramente lo hacen.
  3. Registra esfuerzo con cada solicitud. El costo por solicitud no es interpretable sin él. Un pico de gasto con un conteo de solicitud plano es usualmente un cambio de esfuerzo.
  4. Compara niveles de esfuerzo en las mismas tareas reproducidas. Registra la tasa de éxito y tokens de salida por tarea completada en cada nivel, y deja de subir esfuerzo cuando el éxito deja de mejorar.
  5. Limita salida donde el producto lo permita. Un límite de tokens máximo acota el peor caso. A esfuerzo máximo ese límite es lo único entre una tarea desbocada y una solicitud de varios dólares.

El corte de $25 a $20 por millón de tokens de salida ahorra 20%. Mover una carga de trabajo de máximo a esfuerzo medio puede ahorrar mucho más que eso. Trata esfuerzo como una línea de presupuesto, poseída y revisada como cualquier otra.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research