Guía de Precios de GPT-5.6: Luna, Terra, Sol
Publicado 19 de julio de 2026
OpenAI lanzó GPT-5.6 el 10 de julio con tres niveles de precios distintos: Luna a $1/$6 por 1M tokens, Terra a $2.50/$15 y Sol a $5/$30. Esto no es un simple intercambio velocidad/calidad; cada nivel se posiciona para una clase diferente de carga de trabajo. La pregunta no es "cuál es el mejor" — es "cuál es el correcto para esta tarea?" Esta guía mapea tareas a niveles, camina a través de ejemplos de costes por tarea, y te muestra cómo cascadear inteligentemente cuando un nivel más barato no es lo suficientemente confiado.
- Luna ($1/$6): clasificación, extracción simple, enrutamiento de alto volumen
- Terra ($2.50/$15): razonamiento equilibrado, bucles de agentes, conversaciones multi-turno
- Sol ($5/$30): razonamiento de frontera, generación de código, investigación difícil
- Las lecturas de caché ahorran 90%; las escrituras de caché cuestan 1.25× entrada — punto de equilibrio en 5+ aciertos en 30 min
- La API de lotes añade 50% de descuento además de precios de nivel para trabajo no interactivo
1. Los Tres Niveles: Velocidad, Coste y Capacidad
| Nivel | Entrada $/1M | Salida $/1M | Lectura de Caché $/1M | Contexto | Latencia Típica |
|---|---|---|---|---|---|
| Luna | $1.00 | $6.00 | $0.10 | 128K | 80–200 ms |
| Terra | $2.50 | $15.00 | $0.25 | 128K | 150–400 ms |
| Sol | $5.00 | $30.00 | $0.50 | 128K | 300–800 ms |
La latencia importa: Luna es más rápido porque se optimiza para streaming, clasificación en tiempo real y rendimiento. Sol es más lento porque realiza más razonamiento interno. Para cargas de trabajo interactivas orientadas al usuario, Luna también es más barato y más rápido — pero solo si es lo suficientemente capaz para tu tarea. Esta es la decisión clave de enrutamiento.
2. Tabla de Enrutamiento por Tipo de Tarea
Esta tabla mapea tareas comunes de LLM al nivel que minimiza el coste por respuesta exitosa:
| Tipo de Tarea | Ejemplo | Nivel Recomendado | Tasa de Éxito en Nivel | Coste Est./1K Tareas |
|---|---|---|---|---|
| Clasificación | Spam / no-spam; sentimiento (pos/neg/neutro) | Luna | 95–98% | $1.20–$1.50 |
| Extracción estructurada | Extraer nombre, email, teléfono de texto | Luna | 92–96% | $1.80–$2.40 |
| Categorización (muchas clases) | Asignar una de 50+ categorías de producto | Luna | 88–94% | $2.40–$3.20 |
| Resumen | Condensar artículo o log de chat | Luna | 92–97% | $1.50–$2.00 |
| Bucles de agentes (uso de herramientas) | Multi-turno: buscar, razonar, refinar | Terra | 85–92% | $8.00–$12.00 |
| Conversación multi-turno | Bots de soporte al cliente, asesoramiento | Terra | 88–94% | $6.00–$10.00 |
| Generación de código (simple) | Consulta SQL, snippet Bash, regex | Terra | 80–90% | $10.00–$15.00 |
| Generación de código (compleja) | Endpoint completo, máquina de estados, compilador DSL | Sol | 75–88% | $25.00–$40.00 |
| Investigación + síntesis | Analizar 10+ artículos, sintetizar consenso | Sol | 80–90% | $30.00–$50.00 |
| Razonamiento difícil (problema novel) | Verificación de pruebas, diseño de algoritmo novel | Sol | 70–85% | $40.00–$70.00 |
Insight clave: El coste por tarea no es solo coste API — es (coste API) / (tasa de éxito). Una clasificación Luna con 95% de éxito cuesta ~$1.26 por respuesta exitosa. Si enrutas la misma tarea a Sol con 98% de éxito, pagas ~$5.10 por respuesta — pero has resuelto 3% más de tu carga de trabajo, lo que puede o no valer el coste 4×.
3. Ejemplos Resueltos de Coste Por Tarea
Ejemplo 1: Clasificación de Spam (Luna)
Tarea: Clasificar email como spam (sí/no binario).
Perfil de tokens típico: 400 entrada (email) + 50 salida (clasificación + confianza) = 450 tokens.
Coste Luna: (400 × $1/1M) + (50 × $6/1M) = $0.00043/solicitud.
Si 96% tienen éxito en primer intento: $0.00043 / 0.96 = $0.00045 por clasificación exitosa.
A 1M emails/mes: $450/mes (más descuento de caché si reutilizas prompts del sistema).
Si enrutado incorrectamente a Sol: (400 × $5 + 50 × $30) / 1M = $0.0025 por solicitud. Con 98% de éxito: $0.00255/exitosa = $2,550/mes (5.7× más).
Ejemplo 2: Agente de Soporte al Cliente (Terra)
Tarea: Conversación de soporte multi-turno con uso de herramientas (búsqueda de tickets, búsqueda de políticas, decisión de escalada).
Perfil de tokens típico por turno: 2,000 entrada (contexto + historial) + 400 salida (respuesta + llamadas de herramientas) = 2,400 tokens. Promedio 3 turnos para resolver = 7,200 tokens totales por ticket.
Coste Terra: (2,000 × $2.50/1M) + (400 × $15/1M) = $0.0080/turno o $0.0240 por ticket.
Si 90% se resuelven sin escalada: $0.0240 / 0.90 = $0.0267 por ticket exitoso.
A 10K tickets/mes: $267/mes.
Si usabas Luna en su lugar: (2,000 × $1 + 400 × $6) / 1M = $0.0044 por turno = $0.0132/ticket. Pero el éxito del bucle de agentes de Luna baja a 65% (las llamadas de herramientas fallan, el razonamiento es superficial). Coste por exitosa: $0.0132 / 0.65 = $0.0203. Ahorro neto: $29/mes, pero 25% de tickets fallan y escalan, elevando coste de soporte $400+. Luna no funciona aquí.
Ejemplo 3: Generación de Código (Terra vs Sol)
Tarea: Generar función Python desde cadena de requisito.
Perfil de tokens típico: 1,500 entrada (especificación + ejemplos) + 600 salida (código + explicación) = 2,100 tokens.
Coste Terra: (1,500 × $2.50 + 600 × $15) / 1M = $0.0134 por solicitud. Con 85% de éxito en primer pase (código compila + pasa tests básicos): $0.0158 por función que funciona.
Coste Sol: (1,500 × $5 + 600 × $30) / 1M = $0.0255 por solicitud. Con 90% de éxito en primer pase: $0.0283 por función que funciona.
Ahorro con Terra: 44% más barato por resultado que funciona. Usa Sol solo si la diferencia del 5% en tasa de éxito y calidad de código reduce mediblemente el coste de debugging descendente.
4. Patrón de Enrutamiento Cascade & Fallback
La mayoría de equipos FinOps no deberían usar un solo nivel para todo trabajo. En su lugar, implementa un patrón cascade: comienza con el nivel más barato, mide confianza, escala en confianza baja.
| Paso | Modelo | Umbral de Confianza | Acción si Umbral No Se Cumple |
|---|---|---|---|
| 1 | Luna | Confianza > 85% | Retornar resultado |
| 2 | Terra | Confianza > 75% | Retornar resultado (escalado) |
| 3 | Sol | Confianza > 60% | Retornar resultado o fallar explícitamente |
| 4 | Revisión humana | — | Escalar a humano |
Escenario real: Estás haciendo clasificación de documentos para facturas (clasificar por proveedor). Luna retornará resultados de alta confianza (~94% de éxito) y costará ~$1.20 por 1K. Para el 6% de facturas ambiguas donde Luna retorna confianza < 85%, escala a Terra (~94% de éxito para casos difíciles), costando ~$3.75 por 1K escalaciones. Si 6% de 10K documentos escalan: 600 × $3.75 = $2.25 extra, total $12 + $2.25 = $14.25/10K. Terra puro costaría ~$37.50. Cascade ahorra 62% mientras mejora precisión en casos límite.
5. Economía de Almacenamiento en Caché de Prompts
GPT-5.6 cambió costes de almacenamiento: las escrituras de caché ahora cuestan 1.25× la tasa de entrada sin caché (no gratis), y las lecturas de caché cuestan 10% de entrada.
| Escenario | Tamaño de Prefijo | Coste de Escritura | Coste de Lectura (por acierto) | Aciertos de Punto de Equilibrio | Ahorro @ 10 aciertos/mes |
|---|---|---|---|---|---|
| Contexto de recuperación en caché Luna | 100K tokens | $0.125 | $0.010 | 15 aciertos | -$0.025 (pérdida) |
| Prompt del sistema en caché Luna + docs | 50K tokens | $0.063 | $0.005 | 8 aciertos | $0.032 |
| Contexto de agentes en caché Terra | 80K tokens | $0.250 | $0.020 | 14 aciertos | $0.030 |
| Contexto de razonamiento en caché Sol | 100K tokens | $0.625 | $0.050 | 13 aciertos | $0.025 |
Cuándo cachear: Si tu prompt incluye un prefijo estable (instrucciones del sistema, documentación, ejemplos pocos-disparos) que se reutiliza más de 5–10 veces en una ventana de 30 minutos, el almacenamiento generalmente ahorra dinero. La API de lotes (50% descuento) ahora compite con almacenamiento en coste — si clasificas documentos en lote, el descuento de lote vence la sobrecarga de almacenamiento.
6. Comparación con Claude Sonnet 5, Gemini 3.1 Pro y DeepSeek V4
| Modelo | Entrada $/1M | Salida $/1M | Velocidad | Capacidad de Razonamiento | Cuándo Elegir |
|---|---|---|---|---|---|
| GPT-5.6 Luna | $1.00 | $6.00 | Rápido | Seguimiento de instrucciones, enrutamiento | Clasificación, extracción, rendimiento |
| GPT-5.6 Terra | $2.50 | $15.00 | Medio | Razonamiento moderado, uso de herramientas | Agentes, multi-turno, código medio |
| GPT-5.6 Sol | $5.00 | $30.00 | Lento | Razonamiento de frontera, investigación | Código complejo, razonamiento difícil, problemas novel |
| Claude Sonnet 5 | $2.00–$3.00 | $10.00–$15.00 | Medio–Rápido | Razonamiento fuerte, tokens de razonamiento largo | Razonamiento, codificación (competitivo con Sol) |
| Gemini 3.1 Pro | $2.00 | $12.00 | Medio | Multimodal, capacidad de investigación | Tareas multimodales, competitivo con Terra |
| DeepSeek V4 Flash | $0.14 | $0.28 | Muy Rápido | Razonamiento básico, enfoque entrada en caché | Enrutamiento de alto volumen, cargas de trabajo enfoque en caché (7–35× más barato) |
Arbitraje de costes: Para clasificación simple y extracción, DeepSeek V4 Flash es 7–20× más barato que Luna. Compara contra tus datos — si alcanza 90%+ de precisión, úsalo y guarda la diferencia. Claude Sonnet 5 es 2× más caro que Terra pero proporciona razonamiento más fuerte por pretensión de capacidad de modelo; úsalo si tu benchmark de Terra muestra calidad insuficiente. Gemini 3.1 Pro aterriza entre Luna y Terra — útil si necesitas entrada multimodal o ya estás en el ecosistema Vertex AI.
7. Migración desde GPT-5/5.5 & Estado de Deprecación
OpenAI continúa ofreciendo GPT-5.5 ($5/$30, igual que Sol) y GPT-5.4 ($2.50/$15, igual que Terra) junto a GPT-5.6. No hay presión de deprecación en modelos más antiguos — puedes seguir usando GPT-5.5 si tu código lo apunta. Sin embargo, GPT-5.6 pretende paridad de rendimiento (o mejor) al mismo nivel, así que migra a 5.6 para nuevos despliegues.
La interfaz ChatGPT continúa retirando modelos más antiguos en base continua (GPT-4o mini, GPT-4 turbo ahora son solo lectura); el acceso API es estable. Si construyes contra la API, planifica revisiones anuales del estado de deprecación de modelo pero no esperes urgencia.
Marco de Medición de Costes
Paso 1: Establecer línea base por nivel
Ejecuta una semana de tráfico y registra qué nivel manejó cada solicitud. Esto te da distribución de línea base y coste.
Paso 2: Medir puntuaciones de confianza y tasas de fallback
Para cada nivel, registra confianza retornada. Calcula: qué % de llamadas Luna tienen confianza > 85%? Qué % escalan a Terra? Esto te dice si tu cascade está equilibrado.
Paso 3: Auditar éxito/fallo por nivel
Compara salida de modelo contra verdad de base para una semana. Qué nivel tiene rendimiento insuficiente en tus datos? Ajusta umbrales o selección de nivel basado en precisión real, no pretensiones de OpenAI.
Paso 4: Calcular coste verdadero por respuesta exitosa
Coste verdadero = (coste_nivel) / (tasa_éxito). Si Luna cuesta $1.20 por 1K con 94% de éxito, coste por respuesta que funciona es $1.28. Esta es la métrica a optimizar.
Lista de Verificación Rápida de Selección de Nivel
- ¿Es esta una tarea de clasificación, extracción o enrutamiento? → Luna a menos que la precisión sea crítica.
- ¿Implica la tarea uso de herramientas o razonamiento multi-turno? → Terra.
- ¿Es esto razonamiento novel, código complejo o análisis multi-hop? → Sol (o compara Claude Sonnet 5 primero).
- ¿Puedes implementar un cascade (Luna → Terra → Sol)? → Sí, esto es usualmente óptimo.
- ¿Hay un prefijo estable (prompt del sistema, docs) reutilizado 10+ veces/mes? → Cachealo, mide ROI en punto de equilibrio (5–15 aciertos).
- ¿Es esto lote o interactivo? → Trabajo en lote califica para descuento 50%; recalcula ROI con API de lote.
- ¿Has comparado alternativas (Claude, DeepSeek, Gemini)? → Hazlo en tus datos, no pretensiones de marketing.
La selección de nivel es un problema de clasificación: acopla propiedades de carga de trabajo a economía de nivel. El ideal es enrutamiento cascade — enruta a Luna primero, mide confianza, escala en incertidumbre. Esto minimiza coste manteniendo calidad. FinOps LLM puede ejecutar una auditoría de costes en tu tráfico LLM y mostrarte dónde desajuste de nivel está dejando dinero en la mesa. Reserva auditoría gratuita.
Ver también: ¿Cuánto Cuesta GPT-5? para el panorama completo de precios de GPT y Costes Ocultos de LLM para infraestructura y gastos indirectos de fallback más allá de cuotas por token.