Seguimiento de Precios API LLM

Actualizado 15 de julio de 2026 · publicado por primera vez el 4 de julio de 2026

Seguimiento de precios por token en todos los principales proveedores de LLM. Entrada, salida, lectura/escritura de caché, ventanas de contexto y descuentos por lotes en una tabla normalizada. Actualizado mensualmente con datos verificables de los proveedores.

12+Proveedores rastreados
25+Modelos listados
6Columnas de precio
Jul 2026Última actualización

Metodología

Recopilación

Datos de precios recopilados de las páginas oficiales de precios y documentación de API de los proveedores.

Normalización

Todos los precios normalizados a USD por 1 millón de tokens para comparación directa.

Precios de caché

Las columnas de Lectura/Escritura de caché muestran descuentos de caché de prompts donde los proveedores los admiten.

Política de visualización

Los valores oficiales y estimados están claramente separados. Las estimaciones se marcan en gris.

Historial de Actualizaciones

4 jul 2026

Seguimiento de Precios API LLM lanzado

Publicada la comparación de precios por token en más de 12 proveedores principales de LLM como artículo de investigación de FinOps LLM.

Tabla de Precios por Token

Proveedor Modelo Entrada $/1M Salida $/1M Lectura Caché $/1M Escritura Caché $/1M Ventana de Contexto Descuento por Lotes
OpenAI GPT-5.6-Sol $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.6-Terra $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI GPT-5.6-Luna $1.00 $6.00 $0.10 $1.25 128K 50%
OpenAI GPT-5.5 $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.4 $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI o3 $2.00 $8.00 $0.50 $2.00 200K 50%
OpenAI o4-mini $1.10 $4.40 $0.28 $1.10 200K 50%
Anthropic Claude Fable 5 $10.00 $50.00 $1.00 $12.50 200K 50%
Anthropic Claude Opus 4.8 $5.00 $25.00 $0.50 $6.25 200K 50%
Anthropic Claude Sonnet 5* $2.00 $10.00 $0.20 $2.50 200K 50%
Anthropic Claude Haiku 4.5 $1.00 $5.00 $0.10 $1.25 200K 50%
Google Gemini 3.5 Flash $1.50 $9.00 $0.15 $1.88 1M 50%
Google Gemini 3.1 Pro Preview $2.00 $12.00 $0.20 $2.50 1M 50%
Google Gemini 2.5 Pro $1.25 $5.00 $0.31 $4.50 1M 50%
Google Gemini 2.5 Flash $0.15 $0.60 $0.04 $0.15 1M 50%
xAI Grok 4.5 $2.00 $6.00 $0.50 $1.50 1M 50%
xAI Grok 4.3 $1.25 $2.50 - - 1M 50%
Meta Llama 4 Maverick (DeepInfra) $0.20 $0.80 - - 1M -
Meta Llama 4 Scout (Groq) $0.11 $0.34 - - 5M -
Meta Llama 3.3 70B (Groq) $0.59 $0.79 - - 8M -
Mistral Mistral Large 2/3 $2.00 $6.00 - - 128K -
Mistral Mistral Medium 3.5 $1.50 $7.50 - - 128K -
Mistral Mistral Small 3 $0.10 $0.30 - - 128K -
Mistral Codestral $0.30 $0.90 - - 128K -
DeepSeek DeepSeek V4 Flash $0.14 $0.28 $0.0028 - 128K -
DeepSeek DeepSeek V4 Pro $0.435 $0.87 $0.0036 - 128K -
Alibaba Qwen Qwen 3.7-Max $2.50 $7.50 - - 131K -
Moonshot Kimi Kimi K2.6 $0.95 $4.00 $0.16 - 200K -
Xiaomi MiMO
Regístrate - ambos obtienen $2 ↗
MiMo-V2-Pro $0.50 $2.00 - - 128K -
Xiaomi MiMO
Regístrate - ambos obtienen $2 ↗
MiMo-V2-Omni $0.40 $1.60 - - 128K -
Zhipu AI GLM-5 $1.00 $4.00 - - 128K -
Zhipu AI GLM-5-Turbo $0.30 $1.20 - - 128K -
MiniMax M2.7 $0.40 $1.60 - - 128K -
StepFun step-3.5-flash $0.30 $1.20 - - 128K -

* Claude Sonnet 5: precios introductorios de $2/$10 por 1M tokens en efecto hasta el 31 de agosto de 2026; los precios estándar de $3/$15 comienzan el 1 de septiembre de 2026.

Los valores no proporcionados explícitamente por los proveedores se muestran en gris.

Los precios de Meta Llama reflejan precios de API alojada (Fireworks, Together, etc.), no el coste de autoalojamiento. La economía del autoalojamiento se cubre en nuestra Comparación de Costes Open-Source vs Closed-Source.

Las ventanas de contexto son las máximas admitidas; la disponibilidad real puede variar según el nivel.

Los precios de Lectura/Escritura de caché reflejan el caché de prompts específico del proveedor donde está disponible. "-" significa que el proveedor no ofrece caché o el precio no está publicado.

El Descuento por Lotes muestra el ahorro aproximado al usar APIs por lotes/asíncronas donde están disponibles.

Algunos enlaces pueden incluir códigos de referido.

Los precios pueden cambiar frecuentemente. Siempre verifica la información más reciente en las páginas oficiales de los proveedores.

Guía Práctica

Cómo usar estos datos de precios para la planificación de costes

1) Calcula primero tu volumen de tokens

Antes de comparar precios, estima tus volúmenes mensuales de tokens de entrada y salida. Los tokens de salida suelen ser 3-5x más caros que los de entrada, por lo que reducir la longitud de salida tiene el mayor impacto en el coste.

2) Ten en cuenta los ahorros de caché

Si tu carga de trabajo tiene prompts de sistema o contexto repetidos (RAG, conversaciones de múltiples turnos), el caché de prompts puede reducir los costes de entrada en un 50-90%. Consulta la columna de Lectura de Caché para los descuentos aplicables.

3) Usa APIs por lotes para trabajo no urgente

La mayoría de los proveedores principales ofrecen descuentos del 50% en llamadas de API por lotes/asíncronas. Si tu carga de trabajo tolera latencia (evaluaciones, procesamiento de datos, generación de contenido), los precios por lotes reducen los costes a la mitad.

4) Compara el coste total, no solo el precio por token

Un modelo barato que necesita 3x más tokens para igualar la calidad puede costar más en total. Ten en cuenta la calidad del modelo y el rendimiento específico de la tarea junto con los precios brutos.


¿Quieres esto aplicado a tu propio gasto en LLM? FinOps LLM realiza una auditoría gratuita de tus costes de IA y muestra dónde están los ahorros. Reserva auditoría gratuita →

Volver a investigación