Guía de Precios de GPT-5.6: Luna, Terra, Sol

Publicado 19 de julio de 2026

OpenAI lanzó GPT-5.6 el 10 de julio con tres niveles de precios distintos: Luna a $1/$6 por 1M tokens, Terra a $2.50/$15 y Sol a $5/$30. Esto no es un simple intercambio velocidad/calidad; cada nivel se posiciona para una clase diferente de carga de trabajo. La pregunta no es "cuál es el mejor" — es "cuál es el correcto para esta tarea?" Esta guía mapea tareas a niveles, camina a través de ejemplos de costes por tarea, y te muestra cómo cascadear inteligentemente cuando un nivel más barato no es lo suficientemente confiado.

Caveat crítico: OpenAI posiciona Terra y Sol como teniendo capacidad de razonamiento equivalente, diferenciándose principalmente en velocidad y rendimiento. Compara ambos contra tu carga de trabajo real — la pretensión de paridad no siempre se mantiene en tu distribución de datos. Ver GPT-5 vs alternativas para comparación con Claude y DeepSeek.

1. Los Tres Niveles: Velocidad, Coste y Capacidad

Nivel Entrada $/1M Salida $/1M Lectura de Caché $/1M Contexto Latencia Típica
Luna $1.00 $6.00 $0.10 128K 80–200 ms
Terra $2.50 $15.00 $0.25 128K 150–400 ms
Sol $5.00 $30.00 $0.50 128K 300–800 ms

La latencia importa: Luna es más rápido porque se optimiza para streaming, clasificación en tiempo real y rendimiento. Sol es más lento porque realiza más razonamiento interno. Para cargas de trabajo interactivas orientadas al usuario, Luna también es más barato y más rápido — pero solo si es lo suficientemente capaz para tu tarea. Esta es la decisión clave de enrutamiento.

2. Tabla de Enrutamiento por Tipo de Tarea

Esta tabla mapea tareas comunes de LLM al nivel que minimiza el coste por respuesta exitosa:

Tipo de Tarea Ejemplo Nivel Recomendado Tasa de Éxito en Nivel Coste Est./1K Tareas
Clasificación Spam / no-spam; sentimiento (pos/neg/neutro) Luna 95–98% $1.20–$1.50
Extracción estructurada Extraer nombre, email, teléfono de texto Luna 92–96% $1.80–$2.40
Categorización (muchas clases) Asignar una de 50+ categorías de producto Luna 88–94% $2.40–$3.20
Resumen Condensar artículo o log de chat Luna 92–97% $1.50–$2.00
Bucles de agentes (uso de herramientas) Multi-turno: buscar, razonar, refinar Terra 85–92% $8.00–$12.00
Conversación multi-turno Bots de soporte al cliente, asesoramiento Terra 88–94% $6.00–$10.00
Generación de código (simple) Consulta SQL, snippet Bash, regex Terra 80–90% $10.00–$15.00
Generación de código (compleja) Endpoint completo, máquina de estados, compilador DSL Sol 75–88% $25.00–$40.00
Investigación + síntesis Analizar 10+ artículos, sintetizar consenso Sol 80–90% $30.00–$50.00
Razonamiento difícil (problema novel) Verificación de pruebas, diseño de algoritmo novel Sol 70–85% $40.00–$70.00

Insight clave: El coste por tarea no es solo coste API — es (coste API) / (tasa de éxito). Una clasificación Luna con 95% de éxito cuesta ~$1.26 por respuesta exitosa. Si enrutas la misma tarea a Sol con 98% de éxito, pagas ~$5.10 por respuesta — pero has resuelto 3% más de tu carga de trabajo, lo que puede o no valer el coste 4×.

3. Ejemplos Resueltos de Coste Por Tarea

Ejemplo 1: Clasificación de Spam (Luna)

Tarea: Clasificar email como spam (sí/no binario).

Perfil de tokens típico: 400 entrada (email) + 50 salida (clasificación + confianza) = 450 tokens.

Coste Luna: (400 × $1/1M) + (50 × $6/1M) = $0.00043/solicitud.

Si 96% tienen éxito en primer intento: $0.00043 / 0.96 = $0.00045 por clasificación exitosa.

A 1M emails/mes: $450/mes (más descuento de caché si reutilizas prompts del sistema).

Si enrutado incorrectamente a Sol: (400 × $5 + 50 × $30) / 1M = $0.0025 por solicitud. Con 98% de éxito: $0.00255/exitosa = $2,550/mes (5.7× más).

Ejemplo 2: Agente de Soporte al Cliente (Terra)

Tarea: Conversación de soporte multi-turno con uso de herramientas (búsqueda de tickets, búsqueda de políticas, decisión de escalada).

Perfil de tokens típico por turno: 2,000 entrada (contexto + historial) + 400 salida (respuesta + llamadas de herramientas) = 2,400 tokens. Promedio 3 turnos para resolver = 7,200 tokens totales por ticket.

Coste Terra: (2,000 × $2.50/1M) + (400 × $15/1M) = $0.0080/turno o $0.0240 por ticket.

Si 90% se resuelven sin escalada: $0.0240 / 0.90 = $0.0267 por ticket exitoso.

A 10K tickets/mes: $267/mes.

Si usabas Luna en su lugar: (2,000 × $1 + 400 × $6) / 1M = $0.0044 por turno = $0.0132/ticket. Pero el éxito del bucle de agentes de Luna baja a 65% (las llamadas de herramientas fallan, el razonamiento es superficial). Coste por exitosa: $0.0132 / 0.65 = $0.0203. Ahorro neto: $29/mes, pero 25% de tickets fallan y escalan, elevando coste de soporte $400+. Luna no funciona aquí.

Ejemplo 3: Generación de Código (Terra vs Sol)

Tarea: Generar función Python desde cadena de requisito.

Perfil de tokens típico: 1,500 entrada (especificación + ejemplos) + 600 salida (código + explicación) = 2,100 tokens.

Coste Terra: (1,500 × $2.50 + 600 × $15) / 1M = $0.0134 por solicitud. Con 85% de éxito en primer pase (código compila + pasa tests básicos): $0.0158 por función que funciona.

Coste Sol: (1,500 × $5 + 600 × $30) / 1M = $0.0255 por solicitud. Con 90% de éxito en primer pase: $0.0283 por función que funciona.

Ahorro con Terra: 44% más barato por resultado que funciona. Usa Sol solo si la diferencia del 5% en tasa de éxito y calidad de código reduce mediblemente el coste de debugging descendente.

4. Patrón de Enrutamiento Cascade & Fallback

La mayoría de equipos FinOps no deberían usar un solo nivel para todo trabajo. En su lugar, implementa un patrón cascade: comienza con el nivel más barato, mide confianza, escala en confianza baja.

Paso Modelo Umbral de Confianza Acción si Umbral No Se Cumple
1 Luna Confianza > 85% Retornar resultado
2 Terra Confianza > 75% Retornar resultado (escalado)
3 Sol Confianza > 60% Retornar resultado o fallar explícitamente
4 Revisión humana Escalar a humano

Escenario real: Estás haciendo clasificación de documentos para facturas (clasificar por proveedor). Luna retornará resultados de alta confianza (~94% de éxito) y costará ~$1.20 por 1K. Para el 6% de facturas ambiguas donde Luna retorna confianza < 85%, escala a Terra (~94% de éxito para casos difíciles), costando ~$3.75 por 1K escalaciones. Si 6% de 10K documentos escalan: 600 × $3.75 = $2.25 extra, total $12 + $2.25 = $14.25/10K. Terra puro costaría ~$37.50. Cascade ahorra 62% mientras mejora precisión en casos límite.

5. Economía de Almacenamiento en Caché de Prompts

GPT-5.6 cambió costes de almacenamiento: las escrituras de caché ahora cuestan 1.25× la tasa de entrada sin caché (no gratis), y las lecturas de caché cuestan 10% de entrada.

Escenario Tamaño de Prefijo Coste de Escritura Coste de Lectura (por acierto) Aciertos de Punto de Equilibrio Ahorro @ 10 aciertos/mes
Contexto de recuperación en caché Luna 100K tokens $0.125 $0.010 15 aciertos -$0.025 (pérdida)
Prompt del sistema en caché Luna + docs 50K tokens $0.063 $0.005 8 aciertos $0.032
Contexto de agentes en caché Terra 80K tokens $0.250 $0.020 14 aciertos $0.030
Contexto de razonamiento en caché Sol 100K tokens $0.625 $0.050 13 aciertos $0.025

Cuándo cachear: Si tu prompt incluye un prefijo estable (instrucciones del sistema, documentación, ejemplos pocos-disparos) que se reutiliza más de 5–10 veces en una ventana de 30 minutos, el almacenamiento generalmente ahorra dinero. La API de lotes (50% descuento) ahora compite con almacenamiento en coste — si clasificas documentos en lote, el descuento de lote vence la sobrecarga de almacenamiento.

6. Comparación con Claude Sonnet 5, Gemini 3.1 Pro y DeepSeek V4

Modelo Entrada $/1M Salida $/1M Velocidad Capacidad de Razonamiento Cuándo Elegir
GPT-5.6 Luna $1.00 $6.00 Rápido Seguimiento de instrucciones, enrutamiento Clasificación, extracción, rendimiento
GPT-5.6 Terra $2.50 $15.00 Medio Razonamiento moderado, uso de herramientas Agentes, multi-turno, código medio
GPT-5.6 Sol $5.00 $30.00 Lento Razonamiento de frontera, investigación Código complejo, razonamiento difícil, problemas novel
Claude Sonnet 5 $2.00–$3.00 $10.00–$15.00 Medio–Rápido Razonamiento fuerte, tokens de razonamiento largo Razonamiento, codificación (competitivo con Sol)
Gemini 3.1 Pro $2.00 $12.00 Medio Multimodal, capacidad de investigación Tareas multimodales, competitivo con Terra
DeepSeek V4 Flash $0.14 $0.28 Muy Rápido Razonamiento básico, enfoque entrada en caché Enrutamiento de alto volumen, cargas de trabajo enfoque en caché (7–35× más barato)

Arbitraje de costes: Para clasificación simple y extracción, DeepSeek V4 Flash es 7–20× más barato que Luna. Compara contra tus datos — si alcanza 90%+ de precisión, úsalo y guarda la diferencia. Claude Sonnet 5 es 2× más caro que Terra pero proporciona razonamiento más fuerte por pretensión de capacidad de modelo; úsalo si tu benchmark de Terra muestra calidad insuficiente. Gemini 3.1 Pro aterriza entre Luna y Terra — útil si necesitas entrada multimodal o ya estás en el ecosistema Vertex AI.

7. Migración desde GPT-5/5.5 & Estado de Deprecación

OpenAI continúa ofreciendo GPT-5.5 ($5/$30, igual que Sol) y GPT-5.4 ($2.50/$15, igual que Terra) junto a GPT-5.6. No hay presión de deprecación en modelos más antiguos — puedes seguir usando GPT-5.5 si tu código lo apunta. Sin embargo, GPT-5.6 pretende paridad de rendimiento (o mejor) al mismo nivel, así que migra a 5.6 para nuevos despliegues.

La interfaz ChatGPT continúa retirando modelos más antiguos en base continua (GPT-4o mini, GPT-4 turbo ahora son solo lectura); el acceso API es estable. Si construyes contra la API, planifica revisiones anuales del estado de deprecación de modelo pero no esperes urgencia.

Marco de Medición de Costes

Paso 1: Establecer línea base por nivel

Ejecuta una semana de tráfico y registra qué nivel manejó cada solicitud. Esto te da distribución de línea base y coste.

Paso 2: Medir puntuaciones de confianza y tasas de fallback

Para cada nivel, registra confianza retornada. Calcula: qué % de llamadas Luna tienen confianza > 85%? Qué % escalan a Terra? Esto te dice si tu cascade está equilibrado.

Paso 3: Auditar éxito/fallo por nivel

Compara salida de modelo contra verdad de base para una semana. Qué nivel tiene rendimiento insuficiente en tus datos? Ajusta umbrales o selección de nivel basado en precisión real, no pretensiones de OpenAI.

Paso 4: Calcular coste verdadero por respuesta exitosa

Coste verdadero = (coste_nivel) / (tasa_éxito). Si Luna cuesta $1.20 por 1K con 94% de éxito, coste por respuesta que funciona es $1.28. Esta es la métrica a optimizar.

Lista de Verificación Rápida de Selección de Nivel


La selección de nivel es un problema de clasificación: acopla propiedades de carga de trabajo a economía de nivel. El ideal es enrutamiento cascade — enruta a Luna primero, mide confianza, escala en incertidumbre. Esto minimiza coste manteniendo calidad. FinOps LLM puede ejecutar una auditoría de costes en tu tráfico LLM y mostrarte dónde desajuste de nivel está dejando dinero en la mesa. Reserva auditoría gratuita.

Ver también: ¿Cuánto Cuesta GPT-5? para el panorama completo de precios de GPT y Costes Ocultos de LLM para infraestructura y gastos indirectos de fallback más allá de cuotas por token.

Volver a investigación