Coste real por tarea en los modelos frontera
Updated September 22, 2026 · first published September 22, 2026
Los precios de lista dicen cuánto cuesta un token. No dicen cuánto cuesta una tarea terminada, porque los modelos gastan cantidades de tokens muy distintas para hacer el mismo trabajo. Esta página pone lado a lado el coste por tarea medido y una puntuación de calidad para Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra y GPT-6 Sol en cada nivel de esfuerzo. Cada cifra tiene fuente y nada es una estimación.
La respuesta corta: GPT-6 Sol es la forma más barata de alcanzar cualquier puntuación hasta 47,5. Por encima de 47,5, Opus 5.5 es el más barato en todos los niveles. Ninguna configuración de GPT-6 Astra por encima de low, de Opus 5 o de Fable 5.1 es eficiente en coste: a cada una la supera en puntuación y en precio alguna configuración de Sol o de Opus 5.5.
Método
Todas las puntuaciones y costes proceden del Artificial Analysis Intelligence Index v4.3.2, consultado el 22 de septiembre de 2026. El índice ejecuta diez evaluaciones: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR. Artificial Analysis ejecuta cada modelo en cada nivel de esfuerzo a través de la API del proveedor y registra lo que paga a precios de lista. El coste por tarea es ese gasto por tarea, dividido en entrada y salida. Todas las filas usan el mismo conjunto de pruebas, así que se comparan directamente.
Hay dos límites antes de leer las cifras. Primero, el índice es una sola mezcla de tareas. Tu mezcla moverá los costes, y por eso la última sección explica cómo medir los tuyos. Segundo, las puntuaciones de distintas versiones del índice no son comparables, así que no mezcles estas cifras con números publicados antes.
La escala completa: 26 configuraciones
Los tokens de salida por tarea son los que escribe el modelo, razonamiento incluido. Artificial Analysis no publica el reparto entre entrada y salida para las cuatro configuraciones intermedias de GPT-6 Sol, así que esas celdas indican n/a.
| Modelo | Esfuerzo | Intelligence Index | Coste por tarea | Coste de entrada | Coste de salida | Tokens de salida por tarea | En la frontera |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | No |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | Sí |
| GPT-6 Sol | medium (por defecto) | 39.8 | $0.25 | n/a | n/a | 6,500 | Sí |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | Sí |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | Sí |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | Sí |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | Sí |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | No |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | No |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | No |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | No |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | No |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | No |
| Claude Opus 5 | high (por defecto) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | No |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | No |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | No |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | No |
| Claude Opus 5.5 | medium (por defecto) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | Sí |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | Sí |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | Sí |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | Sí |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | No |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | No |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | No |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | No |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | No |
En la frontera significa que ninguna otra configuración de esta tabla puntúa más por menos dinero.
La frontera de coste
Diez de las 26 configuraciones están en la frontera. Ordenadas por coste, son las únicas que merece la pena considerar solo por precio. Todas las demás pagan más por la misma puntuación o por menos.
| Configuración | Intelligence Index | Coste por tarea | Por 10.000 tareas |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
La frontera tiene dos zonas. De 0,13 $ a 1,06 $ es casi todo GPT-6 Sol, con GPT-6 Astra low como única excepción a 0,82 $. Desde 1,34 $ hacia arriba es solo Opus 5.5. El salto entre ambas zonas es pequeño: Opus 5.5 medium puntúa 3,7 puntos más que Sol max por 0,28 $ más por tarea.
Cara a cara con igual o mejor puntuación
Cada par compara una configuración más barata con otra más cara que puntúa igual o menos.
| Configuración más barata | Configuración más cara | Diferencia de puntuación | Ahorro |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | +3.1 para Opus 5.5 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | +0.4 para Opus 5.5 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | empate | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | +0.9 para Opus 5.5 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | +0.2 para Opus 5.5 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | +0.6 para Opus 5 | 71% |
La fila de Opus 5 importa a los equipos que aún no han migrado. Opus 5 funcionaba por defecto en esfuerzo high. Opus 5.5 funciona por defecto en medium y, con ese valor, puntúa 3,1 puntos más por un 63 % menos por tarea. Anthropic dice que Opus 5.5 es un 40 % más barato que Opus 5; la diferencia medida en este índice es mayor que lo que afirma.
Adónde va el dinero: a la entrada, no a la salida
En todos los modelos, la entrada supone entre la mitad y tres cuartas partes del coste por tarea. En Opus 5.5 medium, 0,82 $ de los 1,34 $ son entrada, un 61 %. En GPT-6 Astra max es el 58 %, en GPT-6 Sol max el 70 % y en Fable 5.1 max el 49 %. Las tareas de agente reenvían su contexto creciente en cada paso, así que el gasto de entrada crece con el número de pasos y no solo con la longitud de la respuesta.
Por eso GPT-6 Sol sin razonamiento cuesta más que en low: 0,33 $ frente a 0,13 $, aunque solo escribe 4.900 tokens de salida. 0,28 $ de los 0,33 $ son entrada. La causa probable es que da más pasos y cada uno reenvía el contexto. Desactivar el razonamiento no abarata un agente si luego necesita más turnos.
Para tu factura, esto significa que la caché importa tanto como la elección de modelo. Opus 5.5 y GPT-6 Sol cobran 0,20 $ por millón de tokens de entrada en caché. GPT-6 Astra cobra 1,00 $ y Opus 5 cobra 0,50 $.
Volumen de tokens frente a precio de lista
GPT-6 Astra es el modelo más eficiente en tokens de esta lista. En esfuerzo max escribe 27.200 tokens de salida por tarea, frente a 119.200 de Opus 5.5 max. Pero Astra cobra 10 $ y 50 $ por millón, 2,5× la tarifa de Opus 5.5. Gana el precio de lista: Opus 5.5 high cuesta 1,82 $ por tarea y puntúa 53,6, mientras que Astra max cuesta 3,26 $ y puntúa 52,7.
Opus 5.5 max es el único punto donde la verbosidad pesa. Sus 119.200 tokens de salida cuestan 2,38 $ antes de cualquier entrada, y la tarea completa cuesta 5,98 $. Eso compra la puntuación más alta de la tabla, 57,6, pero es 4,5× el coste de medium.
Rendimientos decrecientes por esfuerzo
Cada fila muestra lo que compra subir un nivel de esfuerzo, en puntos de índice frente al coste extra por tarea.
| Modelo | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +3.0 puntos por +48% | +3.4 puntos por +100% |
| GPT-6 Astra | +1.3 puntos por +12% | +0.3 puntos por +41% |
| Claude Opus 5 | +3.3 puntos por +65% | +1.1 puntos por +20% |
| Claude Opus 5.5 | +2.4 puntos por +36% | +1.6 puntos por +73% |
| Claude Fable 5.1 | +2.3 puntos por +31% | +0.2 puntos por +28% |
En Fable 5.1 y GPT-6 Astra, el esfuerzo max no compra casi nada: 0,2 y 0,3 puntos por un 28 % y un 41 % más. En Opus 5.5, pasar a max aún compra 1,6 puntos, pero cuesta un 73 % más. Usa max solo en tareas donde hayas medido que los puntos extra cambian el resultado.
Cuándo basta GPT-6 Sol max
El índice es una media, y la distancia entre Sol max y Opus 5.5 medium no es uniforme. Puntuaciones por evaluación de Artificial Analysis:
| Evaluación | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
En AutomationBench y CritPt, GPT-6 Sol iguala o supera a Opus 5.5 medium por 1,06 $ por tarea frente a 1,34 $. En Terminal-Bench, las evaluaciones de trabajo del conocimiento y Humanity's Last Exam, Opus 5.5 gana por mucho. La automatización de flujos de trabajo puede ir en Sol. Los agentes de terminal y de código y el trabajo del conocimiento con muchos documentos son donde Opus 5.5 justifica su precio.
Cifras del proveedor frente a cifras independientes
Las cifras del proveedor y las independientes suelen diferir, porque usan otros entornos de prueba y otros ajustes. Anthropic publica un 66,4 % en Terminal-Bench 4.0 para Opus 5.5 en xhigh. Artificial Analysis mide un 59,6 % con el mismo esfuerzo.
| Esfuerzo | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
La clasificación también cambia según el índice. En el Vals AI Index, Fable 5.1 es primero con 68,83 %, GPT-6 Astra tercero con 66,61 % y Opus 5.5 cuarto con 66,16 %. Allí no se publica el coste por tarea con la misma base, así que no mueve la frontera de arriba. Recuerda que un índice es solo una perspectiva.
Precios de lista y una tarea con mucha caché
Digital Applied calculó el precio de una tarea de agente con mucha caché en cada modelo: 8M tokens de lectura de caché, 400K de entrada sin caché, 600K de escritura en caché y 300K de salida. El resultado sigue la frontera, con una penalización adicional para GPT-6 Astra.
| Modelo | Entrada $/MTok | Salida $/MTok | Lectura de caché $/MTok | Tarea con mucha caché (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra factura toda la petición a 20 $ y 75 $ por millón cuando la entrada supera los 272K tokens. Opus 5.5 mantiene un solo precio en toda su ventana de 1M tokens. En Opus 5.5, escribir en caché cuesta 5 $ por millón para la caché de 5 minutos y 8 $ para la de 1 hora, los lotes se facturan al 50 % y el modo rápido duplica el precio. Para los detalles, consulta Modelo de costes de Claude Opus 5.5 y Economía del modo rápido de Opus 5.5.
Cómo medir tu propio coste por tarea
- Registra tokens por tarea, no por petición: entrada sin caché, entrada en caché, escrituras en caché y salida, sumados en todos los pasos de la tarea.
- Toma una muestra de unos cientos de tareas reales y repítela en dos o tres configuraciones candidatas, por ejemplo Sol max, Opus 5.5 medium y Opus 5.5 high.
- Evalúa cada resultado con la misma comprobación que usas en producción y cuenta las tareas que la superan.
- Divide el gasto total entre las tareas superadas. El coste por tarea exitosa es la cifra que hay que comparar, porque una configuración barata que falla más no es barata.
- Elige la configuración más barata que cumpla tu listón de calidad y envía solo las tareas que fallen a una configuración superior.
- Repite la prueba cuando cambie un precio o un esfuerzo por defecto.
Para ver cómo el esfuerzo cambia la factura de un mismo modelo, consulta Los niveles de esfuerzo de Opus 5.5 son el precio real.
Advertencias
- Todos los costes son a precios de lista de la API sobre la mezcla de tareas de Artificial Analysis. Los descuentos, los lotes y tu propia caché los cambian.
- Artificial Analysis etiqueta sus entradas de Opus 5.5 y Fable 5.1 como Default Fallback. Revisa sus notas de metodología antes de tratar cada fila como la misma configuración de API.
- Las puntuaciones son solo de la versión v4.3.2 del índice. Las versiones anteriores usaban otras evaluaciones y no son comparables.
- La tarea con mucha caché de Digital Applied es una carga ilustrativa, no una medición.
- Las cifras cambian cuando los proveedores cambian precios o valores por defecto. La fecha de consulta es el 22 de septiembre de 2026.
Fuentes
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
- Modelo de costes de Claude Opus 5.5
- Los niveles de esfuerzo de Opus 5.5 son el precio real
- Economía del modo rápido de Opus 5.5
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →