Benchmarks de contexto longo do GPT-6 Sol: o que foi realmente medido e o que é do GPT-5.6 Sol
Atualizado September 27, 2026 · publicado originalmente September 27, 2026
Em 27 de setembro de 2026, o GPT-6 Sol tem exatamente uma pontuação independente de contexto longo: 84% no Artificial Analysis AA-LCR v1.1, empatado com o GPT-5.6 Sol. Os documentos do teste têm em média cerca de 100K tokens. Ninguém publicou ainda como o GPT-6 Sol se comporta com 256K, 512K ou 1M de tokens. A maioria dos números de contexto longo de «Sol» na internet, incluindo a pontuação de 91,5% no MRCR, é do GPT-5.6 Sol. O GPT-6 Sol foi lançado em 22 de setembro.
Isso importa para o custo porque o contexto longo é onde os preços do GPT-6 saltam. Acima de 272K tokens de entrada, a requisição inteira é cobrada pelas tarifas de contexto longo. Decidir quanto contexto um agente mantém significa pesar esse preço contra dados de qualidade que ainda não existem.
Quais pontuações de contexto longo o GPT-6 Sol tem?
Uma pontuação agregada, com cerca de 100K tokens.
| Modelo | AA-LCR v1.1 | Posição |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (líder, 24 set. 2026) | 88.7% | 1 |
O AA-LCR tem 100 perguntas escritas à mão sobre conjuntos de documentos com média de 99.325 tokens. As respostas precisam ser montadas a partir de várias passagens, em vez de encontradas em uma só. Ele testa o raciocínio sobre uma entrada longa. Não mostra como a precisão muda conforme a entrada cresce, porque todas as perguntas têm aproximadamente o mesmo tamanho.
Quais números de contexto longo são do GPT-5.6 Sol, e não do GPT-6 Sol?
As pontuações do MRCR. A cobertura do lançamento do GPT-6 Astra o comparou com o «Sol» no teste MRCR v2 de 8 agulhas da OpenAI. Esse Sol era o GPT-5.6 Sol, e o artigo da Vellum confirma.
| MRCR v2, 8 agulhas | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | não publicado | |
A análise do GPT-6 Sol feita pela OrcaRouter diz o mesmo: o GPT-5.6 Sol tem um resultado publicado de recuperação em contexto longo, e o GPT-6 Sol não tem nada equivalente.
Onde procuramos?
Os lugares onde isso seria publicado, todos verificados em 27 de setembro de 2026:
- Context Arena, o ranking MRCR. A lista de modelos e os resultados de 8 agulhas não têm entradas do GPT-6. Os modelos mais recentes da OpenAI são GPT-5.6 Sol, Terra e Luna.
- OpenAI: o post de lançamento do GPT-6 e o apêndice da system card para Sol e Luna. Nenhum dos dois traz resultados do Sol por tamanho de contexto.
- Artificial Analysis: apenas o AA-LCR, como acima.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats e OrcaRouter: nenhum resultado de contexto longo por tamanho para o GPT-6 Sol.
O que as equipes devem fazer até existirem dados por tamanho?
Manter as requisições ao GPT-6 Sol abaixo de 272K tokens de entrada e compactar cedo. A evidência até agora mostra o GPT-6 Sol igualando o GPT-5.6 Sol com cerca de 100K. O GPT-5.6 Sol manteve 91,5% até 512K no MRCR, mas caiu para 73,8% além disso. É razoável esperar que o GPT-6 Sol seja utilizável até cerca de 250K, mas isso é uma inferência, não uma medição. Acima de 272K você paga o dobro pela entrada em troca de uma qualidade que ninguém mediu.
No Codex isso já é o padrão. Ele dá ao GPT-6 Sol uma janela de 272K e compacta em 244.800 tokens. Para os seus próprios agentes, crie alertas para requisições que passem de 272K e trate qualquer aumento como algo a testar. Faça seu próprio teste de recuperação com seus próprios documentos antes de confiar em contexto além de 256K.
Atualizaremos esta página quando a Context Arena ou outro avaliador independente publicar resultados do GPT-6 Sol por tamanho de contexto.
Fontes
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis: anúncio do AA-LCR
- BenchLM: ranking AA-LCR
- Vellum: benchmarks do GPT-6 Astra explicados
- OrcaRouter: GPT-6 Sol vs GPT-5.6 Sol
- Context Arena: ranking MRCR
Artigos relacionados
- Auto-compact do Codex no GPT-6 Sol: os padrões reais
- Preços e modelo de custos do GPT-6 Sol
- Preços do GPT-6 e o salto de preço do contexto longo de 272K
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →