Coste real por tarea en los modelos frontera

Updated September 22, 2026 · first published September 22, 2026

Los precios de lista dicen cuánto cuesta un token. No dicen cuánto cuesta una tarea terminada, porque los modelos gastan cantidades de tokens muy distintas para hacer el mismo trabajo. Esta página pone lado a lado el coste por tarea medido y una puntuación de calidad para Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra y GPT-6 Sol en cada nivel de esfuerzo. Cada cifra tiene fuente y nada es una estimación.

La respuesta corta: GPT-6 Sol es la forma más barata de alcanzar cualquier puntuación hasta 47,5. Por encima de 47,5, Opus 5.5 es el más barato en todos los niveles. Ninguna configuración de GPT-6 Astra por encima de low, de Opus 5 o de Fable 5.1 es eficiente en coste: a cada una la supera en puntuación y en precio alguna configuración de Sol o de Opus 5.5.

Método

Todas las puntuaciones y costes proceden del Artificial Analysis Intelligence Index v4.3.2, consultado el 22 de septiembre de 2026. El índice ejecuta diez evaluaciones: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR. Artificial Analysis ejecuta cada modelo en cada nivel de esfuerzo a través de la API del proveedor y registra lo que paga a precios de lista. El coste por tarea es ese gasto por tarea, dividido en entrada y salida. Todas las filas usan el mismo conjunto de pruebas, así que se comparan directamente.

Hay dos límites antes de leer las cifras. Primero, el índice es una sola mezcla de tareas. Tu mezcla moverá los costes, y por eso la última sección explica cómo medir los tuyos. Segundo, las puntuaciones de distintas versiones del índice no son comparables, así que no mezcles estas cifras con números publicados antes.

La escala completa: 26 configuraciones

Los tokens de salida por tarea son los que escribe el modelo, razonamiento incluido. Artificial Analysis no publica el reparto entre entrada y salida para las cuatro configuraciones intermedias de GPT-6 Sol, así que esas celdas indican n/a.

ModeloEsfuerzoIntelligence IndexCoste por tareaCoste de entradaCoste de salidaTokens de salida por tareaEn la frontera
GPT-6 Solnone28.1$0.33$0.28$0.054,900No
GPT-6 Sollow33.9$0.13n/an/a3,400
GPT-6 Solmedium (por defecto)39.8$0.25n/an/a6,500
GPT-6 Solhigh42.8$0.37n/an/a10,200
GPT-6 Solxhigh44.1$0.53n/an/a16,000
GPT-6 Solmax47.5$1.06$0.74$0.3131,200
GPT-6 Astralow45.8$0.82$0.60$0.224,400
GPT-6 Astramedium49.6$1.54$1.06$0.489,600No
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800No
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900No
GPT-6 Astramax52.7$3.26$1.90$1.3627,200No
Claude Opus 5low39.4$1.10$0.73$0.3714,700No
Claude Opus 5medium44.8$2.19$1.47$0.7229,000No
Claude Opus 5high (por defecto)48.1$3.61$2.46$1.1646,200No
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700No
Claude Opus 5max50.8$5.86$4.05$1.8172,500No
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200No
Claude Opus 5.5medium (por defecto)51.2$1.34$0.82$0.5125,700
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600No
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900No
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100No
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500No
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100No

En la frontera significa que ninguna otra configuración de esta tabla puntúa más por menos dinero.

La frontera de coste

Diez de las 26 configuraciones están en la frontera. Ordenadas por coste, son las únicas que merece la pena considerar solo por precio. Todas las demás pagan más por la misma puntuación o por menos.

ConfiguraciónIntelligence IndexCoste por tareaPor 10.000 tareas
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

La frontera tiene dos zonas. De 0,13 $ a 1,06 $ es casi todo GPT-6 Sol, con GPT-6 Astra low como única excepción a 0,82 $. Desde 1,34 $ hacia arriba es solo Opus 5.5. El salto entre ambas zonas es pequeño: Opus 5.5 medium puntúa 3,7 puntos más que Sol max por 0,28 $ más por tarea.

Cara a cara con igual o mejor puntuación

Cada par compara una configuración más barata con otra más cara que puntúa igual o menos.

Configuración más barataConfiguración más caraDiferencia de puntuaciónAhorro
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 para Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 para Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91empate66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 para Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 para Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 para Opus 571%

La fila de Opus 5 importa a los equipos que aún no han migrado. Opus 5 funcionaba por defecto en esfuerzo high. Opus 5.5 funciona por defecto en medium y, con ese valor, puntúa 3,1 puntos más por un 63 % menos por tarea. Anthropic dice que Opus 5.5 es un 40 % más barato que Opus 5; la diferencia medida en este índice es mayor que lo que afirma.

Adónde va el dinero: a la entrada, no a la salida

En todos los modelos, la entrada supone entre la mitad y tres cuartas partes del coste por tarea. En Opus 5.5 medium, 0,82 $ de los 1,34 $ son entrada, un 61 %. En GPT-6 Astra max es el 58 %, en GPT-6 Sol max el 70 % y en Fable 5.1 max el 49 %. Las tareas de agente reenvían su contexto creciente en cada paso, así que el gasto de entrada crece con el número de pasos y no solo con la longitud de la respuesta.

Por eso GPT-6 Sol sin razonamiento cuesta más que en low: 0,33 $ frente a 0,13 $, aunque solo escribe 4.900 tokens de salida. 0,28 $ de los 0,33 $ son entrada. La causa probable es que da más pasos y cada uno reenvía el contexto. Desactivar el razonamiento no abarata un agente si luego necesita más turnos.

Para tu factura, esto significa que la caché importa tanto como la elección de modelo. Opus 5.5 y GPT-6 Sol cobran 0,20 $ por millón de tokens de entrada en caché. GPT-6 Astra cobra 1,00 $ y Opus 5 cobra 0,50 $.

Volumen de tokens frente a precio de lista

GPT-6 Astra es el modelo más eficiente en tokens de esta lista. En esfuerzo max escribe 27.200 tokens de salida por tarea, frente a 119.200 de Opus 5.5 max. Pero Astra cobra 10 $ y 50 $ por millón, 2,5× la tarifa de Opus 5.5. Gana el precio de lista: Opus 5.5 high cuesta 1,82 $ por tarea y puntúa 53,6, mientras que Astra max cuesta 3,26 $ y puntúa 52,7.

Opus 5.5 max es el único punto donde la verbosidad pesa. Sus 119.200 tokens de salida cuestan 2,38 $ antes de cualquier entrada, y la tarea completa cuesta 5,98 $. Eso compra la puntuación más alta de la tabla, 57,6, pero es 4,5× el coste de medium.

Rendimientos decrecientes por esfuerzo

Cada fila muestra lo que compra subir un nivel de esfuerzo, en puntos de índice frente al coste extra por tarea.

Modelomedium → highxhigh → max
GPT-6 Sol+3.0 puntos por +48%+3.4 puntos por +100%
GPT-6 Astra+1.3 puntos por +12%+0.3 puntos por +41%
Claude Opus 5+3.3 puntos por +65%+1.1 puntos por +20%
Claude Opus 5.5+2.4 puntos por +36%+1.6 puntos por +73%
Claude Fable 5.1+2.3 puntos por +31%+0.2 puntos por +28%

En Fable 5.1 y GPT-6 Astra, el esfuerzo max no compra casi nada: 0,2 y 0,3 puntos por un 28 % y un 41 % más. En Opus 5.5, pasar a max aún compra 1,6 puntos, pero cuesta un 73 % más. Usa max solo en tareas donde hayas medido que los puntos extra cambian el resultado.

Cuándo basta GPT-6 Sol max

El índice es una media, y la distancia entre Sol max y Opus 5.5 medium no es uniforme. Puntuaciones por evaluación de Artificial Analysis:

EvaluaciónOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

En AutomationBench y CritPt, GPT-6 Sol iguala o supera a Opus 5.5 medium por 1,06 $ por tarea frente a 1,34 $. En Terminal-Bench, las evaluaciones de trabajo del conocimiento y Humanity's Last Exam, Opus 5.5 gana por mucho. La automatización de flujos de trabajo puede ir en Sol. Los agentes de terminal y de código y el trabajo del conocimiento con muchos documentos son donde Opus 5.5 justifica su precio.

Cifras del proveedor frente a cifras independientes

Las cifras del proveedor y las independientes suelen diferir, porque usan otros entornos de prueba y otros ajustes. Anthropic publica un 66,4 % en Terminal-Bench 4.0 para Opus 5.5 en xhigh. Artificial Analysis mide un 59,6 % con el mismo esfuerzo.

EsfuerzoOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

La clasificación también cambia según el índice. En el Vals AI Index, Fable 5.1 es primero con 68,83 %, GPT-6 Astra tercero con 66,61 % y Opus 5.5 cuarto con 66,16 %. Allí no se publica el coste por tarea con la misma base, así que no mueve la frontera de arriba. Recuerda que un índice es solo una perspectiva.

Precios de lista y una tarea con mucha caché

Digital Applied calculó el precio de una tarea de agente con mucha caché en cada modelo: 8M tokens de lectura de caché, 400K de entrada sin caché, 600K de escritura en caché y 300K de salida. El resultado sigue la frontera, con una penalización adicional para GPT-6 Astra.

ModeloEntrada $/MTokSalida $/MTokLectura de caché $/MTokTarea con mucha caché (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra factura toda la petición a 20 $ y 75 $ por millón cuando la entrada supera los 272K tokens. Opus 5.5 mantiene un solo precio en toda su ventana de 1M tokens. En Opus 5.5, escribir en caché cuesta 5 $ por millón para la caché de 5 minutos y 8 $ para la de 1 hora, los lotes se facturan al 50 % y el modo rápido duplica el precio. Para los detalles, consulta Modelo de costes de Claude Opus 5.5 y Economía del modo rápido de Opus 5.5.

Cómo medir tu propio coste por tarea

  1. Registra tokens por tarea, no por petición: entrada sin caché, entrada en caché, escrituras en caché y salida, sumados en todos los pasos de la tarea.
  2. Toma una muestra de unos cientos de tareas reales y repítela en dos o tres configuraciones candidatas, por ejemplo Sol max, Opus 5.5 medium y Opus 5.5 high.
  3. Evalúa cada resultado con la misma comprobación que usas en producción y cuenta las tareas que la superan.
  4. Divide el gasto total entre las tareas superadas. El coste por tarea exitosa es la cifra que hay que comparar, porque una configuración barata que falla más no es barata.
  5. Elige la configuración más barata que cumpla tu listón de calidad y envía solo las tareas que fallen a una configuración superior.
  6. Repite la prueba cuando cambie un precio o un esfuerzo por defecto.

Para ver cómo el esfuerzo cambia la factura de un mismo modelo, consulta Los niveles de esfuerzo de Opus 5.5 son el precio real.

Advertencias

Fuentes

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research