Benchmarks de contexto largo de GPT-6 Sol: qué se ha medido realmente y qué es GPT-5.6 Sol
Actualizado September 27, 2026 · publicado originalmente September 27, 2026
A 27 de septiembre de 2026, GPT-6 Sol tiene exactamente una puntuación independiente de contexto largo: 84 % en Artificial Analysis AA-LCR v1.1, igual que GPT-5.6 Sol. Los documentos de la prueba tienen de media unos 100K tokens. Nadie ha publicado todavía cómo se comporta GPT-6 Sol con 256K, 512K o 1M de tokens. La mayoría de las cifras de contexto largo de «Sol» que circulan en internet, incluida la puntuación de 91,5 % en MRCR, corresponden a GPT-5.6 Sol. GPT-6 Sol salió el 22 de septiembre.
Esto importa para el coste porque el contexto largo es donde los precios de GPT-6 saltan. Por encima de 272K tokens de entrada, toda la solicitud se factura a tarifas de contexto largo. Decidir cuánto contexto conserva un agente implica comparar ese precio con datos de calidad que todavía no existen.
¿Qué puntuaciones de contexto largo tiene GPT-6 Sol?
Una puntuación agregada, con alrededor de 100K tokens.
| Modelo | AA-LCR v1.1 | Puesto |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (líder, 24 sep 2026) | 88.7% | 1 |
AA-LCR tiene 100 preguntas escritas a mano sobre conjuntos de documentos que promedian 99.325 tokens. Las respuestas hay que construirlas a partir de varios pasajes, no encontrarlas en uno solo. Mide el razonamiento sobre una entrada larga. No muestra cómo cambia la precisión al crecer la entrada, porque todas las preguntas tienen una longitud parecida.
¿Qué cifras de contexto largo son de GPT-5.6 Sol y no de GPT-6 Sol?
Las puntuaciones MRCR. La cobertura del lanzamiento de GPT-6 Astra lo comparó con «Sol» en la prueba MRCR v2 de 8 agujas de OpenAI. Ese Sol era GPT-5.6 Sol, y el análisis de Vellum lo confirma.
| MRCR v2, 8 agujas | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | no publicado | |
La reseña de GPT-6 Sol de OrcaRouter dice lo mismo: GPT-5.6 Sol tiene un resultado publicado de recuperación en contexto largo y GPT-6 Sol no tiene nada equivalente.
¿Dónde hemos buscado?
Los lugares donde se publicaría, todos revisados el 27 de septiembre de 2026:
- Context Arena, la clasificación MRCR. Su lista de modelos y sus resultados de 8 agujas no tienen entradas de GPT-6. Sus modelos de OpenAI más recientes son GPT-5.6 Sol, Terra y Luna.
- OpenAI: la entrada de lanzamiento de GPT-6 y el apéndice de la system card para Sol y Luna. Ninguno da resultados de Sol por longitud de contexto.
- Artificial Analysis: solo AA-LCR, como arriba.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats y OrcaRouter: ningún resultado de contexto largo por longitud para GPT-6 Sol.
¿Qué deberían hacer los equipos hasta que haya datos por longitud?
Mantener las solicitudes a GPT-6 Sol por debajo de 272K tokens de entrada y compactar pronto. La evidencia hasta ahora muestra que GPT-6 Sol iguala a GPT-5.6 Sol con unos 100K. GPT-5.6 Sol mantuvo un 91,5 % hasta 512K en MRCR, pero cayó a 73,8 % más allá. Es razonable esperar que GPT-6 Sol sea utilizable hasta unos 250K, pero eso es una inferencia, no una medición. Por encima de 272K se paga el doble por la entrada a cambio de una calidad que nadie ha medido.
En Codex esto ya es el valor por defecto. Da a GPT-6 Sol una ventana de 272K y compacta a 244.800 tokens. Para sus propios agentes, configure alertas para las solicitudes que superen 272K y trate cualquier aumento como algo que debe probarse. Ejecute su propia prueba de recuperación con sus propios documentos antes de confiar en contexto más allá de 256K.
Actualizaremos esta página cuando Context Arena u otro evaluador independiente publique resultados de GPT-6 Sol por longitud de contexto.
Fuentes
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis: presentación de AA-LCR
- BenchLM: clasificación AA-LCR
- Vellum: benchmarks de GPT-6 Astra explicados
- OrcaRouter: GPT-6 Sol vs GPT-5.6 Sol
- Context Arena: clasificación MRCR
Relacionado
- Auto-compact de Codex en GPT-6 Sol: los valores por defecto reales
- Precios y modelo de costes de GPT-6 Sol
- Precios de GPT-6 y el salto de precio por contexto largo de 272K
¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →