Tendencias de costes de LLM 2025–2026
Actualizado 15 de julio de 2026 · publicado por primera vez 4 de julio de 2026
El mercado de LLM se mueve en dos direcciones a la vez. Los precios de tokens de entrada y salida para modelos de clase GPT-4 han caído un 80–90% desde principios de 2024. Al mismo tiempo, los modelos de razonamiento (o1, o3, DeepSeek-R1, Claude Opus 4) son 5–30x más caros por tarea que sus equivalentes sin razonamiento. El efecto neto: los equipos que adoptan modelos de razonamiento ven subir sus facturas incluso cuando los precios unitarios bajan.
Este artículo rastrea los eventos clave de precios y calidad desde 2025 hasta mediados de 2026, explica las fuerzas que impulsan los costes y pronostica qué esperar en el segundo semestre de 2026.
Tendencia clave 1: Los modelos de clase GPT-4 bajaron un 90% en 18 meses
En marzo de 2024, GPT-4-turbo costaba $10 por millón de tokens de entrada y $30 por millón de tokens de salida. Para mediados de 2026, GPT-4.1 cuesta $2 por millón de entrada y $8 por millón de salida: una caída del 75–80%. Claude siguió una trayectoria similar: Claude 3 Opus a $15/$75 bajó a Claude Sonnet 4 a $3/$15. Los modelos de pesos abiertos de Mistral, Llama y DeepSeek empujaron los precios aún más abajo, con algunos disponibles por menos de $0,50 por millón de tokens de entrada a través de proveedores alojados.
Esto no es solo una guerra de precios. La infraestructura de inferencia mejoró: cuantización, decodificación especulativa, optimización de KV-cache y procesamiento por lotes redujeron el coste de servir un token. Los proveedores trasladaron parte de esos ahorros a los clientes.
Tendencia clave 2: Los modelos de razonamiento son 5–30x más caros
Los modelos de razonamiento (o1, o3, o4-mini, DeepSeek-R1, Claude Opus 4 con pensamiento extendido) generan tokens de "pensamiento" internos antes de producir una respuesta final. Estos tokens de pensamiento se facturan como tokens de salida. Un modelo de razonamiento resolviendo una tarea de codificación puede generar 10K–50K tokens de pensamiento antes de producir una respuesta de 2K tokens. El coste efectivo por tarea es por lo tanto mucho más alto de lo que el precio por token sugiere.
Para equipos que usan modelos de razonamiento para cada tarea, este es el mayor factor de coste en 2026. La pregunta clave no es "¿cuánto cuesta el modelo?" sino "¿esta tarea necesita razonamiento?" La mayoría no lo necesita.
Tendencia clave 3: El código abierto cerró la brecha de calidad
A principios de 2024, los modelos de pesos abiertos quedaban significativamente por detrás de los modelos propietarios en benchmarks de codificación y razonamiento. Para mediados de 2026, modelos como Llama 4 Maverick, DeepSeek-V3, Qwen 3 y MiMo están a pocos puntos del rendimiento de clase GPT-4 en la mayoría de benchmarks. Esto importa para el coste porque los modelos de pesos abiertos son más baratos de servir: los proveedores que compiten en precio los usan para reducir los precios propietarios.
La brecha de calidad no se ha cerrado completamente para tareas de razonamiento fronterizo. Pero para la mayoría de las cargas de trabajo de producción: resumen, extracción, clasificación, generación de código, uso de herramientas, los modelos de pesos abiertos son lo suficientemente buenos y significativamente más baratos.
Tendencia clave 4: El caché redujo los costes efectivos un 50–90% para cargas de trabajo repetitivas
El caché de prompts (Anthropic) y el caché automático de contexto (OpenAI, Google) cambiaron la economía de las cargas de trabajo repetitivas. Si envías el mismo prompt de sistema y contexto a un modelo 100 veces al día, las lecturas cacheadas cuestan un 50–90% menos que las lecturas sin caché. Para pipelines de RAG, sistemas de agentes y procesamiento por lotes, esto es transformador.
Los beneficios del caché se distribuyen de forma desigual. Las cargas de trabajo con contexto estable (mismo prompt de sistema, mismo conjunto de documentos) se benefician enormemente. Las cargas de trabajo con contexto dinámico (conversaciones específicas del usuario, datos en tiempo real) se benefician menos. Los equipos de FinOps deben medir su tasa de acierto de caché y optimizar la estabilidad del contexto para maximizar los ahorros.
Tendencia clave 5: Los flujos de trabajo de agentes multiplican el consumo de tokens
Los flujos de trabajo de agentes, donde los modelos llaman a herramientas, leen archivos, ejecutan código e iteran sobre resultados, consumen 5–50x más tokens por tarea que las interacciones de un solo turno. Un agente de codificación resolviendo un bug puede consumir 100K–500K tokens a través de sus llamadas a herramientas, reintentos y acumulación de contexto. Un prompt equivalente de un solo turno podría usar 2K–5K tokens.
Esta es la tendencia de coste más importante en 2026. Los precios de tokens están cayendo, pero el consumo de tokens por tarea está subiendo más rápido. Resultado neto: el gasto total en LLM está subiendo para la mayoría de equipos incluso cuando los precios unitarios bajan.
Línea temporal: eventos clave
| Fecha | Evento | Impacto en precio | Impacto en calidad |
|---|---|---|---|
| Mar 2024 | Lanzamiento de GPT-4-turbo | 50% más barato que GPT-4 | Calidad comparable |
| Jun 2024 | Lanzamiento de Claude 3.5 Sonnet | 5x más barato que Opus | Casi calidad Opus |
| Sep 2024 | Lanzamiento de o1-preview | 3–5x más por tarea (razonamiento) | Gran salto en razonamiento |
| Dic 2024 | Google Gemini 2.0 Flash | Menos de $1/M tokens de entrada | Fuerte para tareas de velocidad |
| Ene 2025 | DeepSeek-R1 código abierto | 10x más barato que o1 | Razonamiento cercano a o1 |
| Feb 2025 | Reducción de precio Claude 3.5 Sonnet | Caída adicional del 20% | Misma calidad |
| Abr 2025 | Lanzamiento de GPT-4.1 | 30% más barato que GPT-4-turbo | Codificación mejorada |
| May 2025 | Lanzamiento de Claude Sonnet 4 | Mismo precio, mejor calidad | Gran salto en codificación |
| Jun 2025 | Reducción de precio OpenAI o3-mini | Razonamiento 50% más barato | Misma calidad |
| Ene 2026 | DeepSeek-V3 en proveedores alojados | Menos de $0,50/M tokens de entrada | Casi clase GPT-4 |
| Abr 2026 | Lanzamiento de Claude Opus 4 | Precio premium ($15/$75) | Razonamiento fronterizo |
| Jun 2026 | Llama 4 Maverick alojado | Menos de $0,30/M tokens de entrada | Calidad general fuerte |
| Jul 2026 | Lanzamiento de Anthropic Fable 5 / OpenAI GPT-5.6 | Nuevo nivel fronterizo ($5/$30), fijación de precios de nivel medio ($2.50/$15), nivel económico ($1/$6) | Fable 5 igualó rendimiento Opus 4 |
Qué esperar en el segundo semestre de 2026
Los precios de modelos de razonamiento caerán un 30–50%. La competencia de modelos de razonamiento de código abierto (DeepSeek-R2, variantes de razonamiento Qwen 3) forzará a los proveedores propietarios a recortar precios en sus niveles de razonamiento.
Surgirá pricing específico para agentes. Los proveedores están probando modelos de precios por tarea y por sesión que agrupan llamadas a herramientas, reintentos y contexto en un solo coste predecible. Espera que al menos un proveedor importante ofrezca esto para el Q4 de 2026.
El caché se volverá automático. La gestión manual de caché desaparecerá. Los proveedores optimizarán la ubicación del caché de forma transparente y las tasas de acierto de caché mejorarán para la mayoría de cargas de trabajo sin intervención del desarrollador.
Los modelos de pesos abiertos dominarán el trabajo rutinario. Para finales de 2026, espera que más del 70% de la inferencia de producción en tareas rutinarias (clasificación, extracción, resumen, generación simple de código) se ejecute en modelos de pesos abiertos a través de proveedores alojados.
El gasto total seguirá subiendo. A pesar de la caída de precios unitarios, los flujos de trabajo impulsados por agentes y la expansión de casos de uso de IA significan que el gasto total en LLM seguirá creciendo. La disciplina FinOps, no solo modelos más baratos, es lo que mantiene el gasto bajo control.
Relacionado
- Economía de agentes - cómo se calculan los precios de los agentes de codificación en la práctica.
- Arbitraje de proveedores - cambiar de proveedor para reducir costes.
- Enrutamiento de modelos - enviar tareas al modelo correcto.
- FinOps para LLM - el marco más amplio.
¿Quieres que esto se aplique a tu propio gasto en LLM? FinOps LLM ejecuta una auditoría gratuita de tus costes en IA y muestra dónde están los ahorros. Solicita tu auditoría gratuita →