Saltar para o conteúdo

Benchmarks de contexto longo do GPT-6 Sol: o que foi realmente medido e o que é do GPT-5.6 Sol

Atualizado September 27, 2026 · publicado originalmente September 27, 2026

Resposta rápida: Em 27 de setembro de 2026, o GPT-6 Sol tem exatamente uma pontuação independente de contexto longo: 84% no Artificial Analysis AA-LCR v1.1, empatado com o GPT-5.6 Sol. Os documentos do teste têm em...

Em 27 de setembro de 2026, o GPT-6 Sol tem exatamente uma pontuação independente de contexto longo: 84% no Artificial Analysis AA-LCR v1.1, empatado com o GPT-5.6 Sol. Os documentos do teste têm em média cerca de 100K tokens. Ninguém publicou ainda como o GPT-6 Sol se comporta com 256K, 512K ou 1M de tokens. A maioria dos números de contexto longo de «Sol» na internet, incluindo a pontuação de 91,5% no MRCR, é do GPT-5.6 Sol. O GPT-6 Sol foi lançado em 22 de setembro.

Isso importa para o custo porque o contexto longo é onde os preços do GPT-6 saltam. Acima de 272K tokens de entrada, a requisição inteira é cobrada pelas tarifas de contexto longo. Decidir quanto contexto um agente mantém significa pesar esse preço contra dados de qualidade que ainda não existem.

Quais pontuações de contexto longo o GPT-6 Sol tem?

Uma pontuação agregada, com cerca de 100K tokens.

ModeloAA-LCR v1.1Posição
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (líder, 24 set. 2026)88.7%1

O AA-LCR tem 100 perguntas escritas à mão sobre conjuntos de documentos com média de 99.325 tokens. As respostas precisam ser montadas a partir de várias passagens, em vez de encontradas em uma só. Ele testa o raciocínio sobre uma entrada longa. Não mostra como a precisão muda conforme a entrada cresce, porque todas as perguntas têm aproximadamente o mesmo tamanho.

Quais números de contexto longo são do GPT-5.6 Sol, e não do GPT-6 Sol?

As pontuações do MRCR. A cobertura do lançamento do GPT-6 Astra o comparou com o «Sol» no teste MRCR v2 de 8 agulhas da OpenAI. Esse Sol era o GPT-5.6 Sol, e o artigo da Vellum confirma.

MRCR v2, 8 agulhas256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solnão publicado

A análise do GPT-6 Sol feita pela OrcaRouter diz o mesmo: o GPT-5.6 Sol tem um resultado publicado de recuperação em contexto longo, e o GPT-6 Sol não tem nada equivalente.

Onde procuramos?

Os lugares onde isso seria publicado, todos verificados em 27 de setembro de 2026:

O que as equipes devem fazer até existirem dados por tamanho?

Manter as requisições ao GPT-6 Sol abaixo de 272K tokens de entrada e compactar cedo. A evidência até agora mostra o GPT-6 Sol igualando o GPT-5.6 Sol com cerca de 100K. O GPT-5.6 Sol manteve 91,5% até 512K no MRCR, mas caiu para 73,8% além disso. É razoável esperar que o GPT-6 Sol seja utilizável até cerca de 250K, mas isso é uma inferência, não uma medição. Acima de 272K você paga o dobro pela entrada em troca de uma qualidade que ninguém mediu.

No Codex isso já é o padrão. Ele dá ao GPT-6 Sol uma janela de 272K e compacta em 244.800 tokens. Para os seus próprios agentes, crie alertas para requisições que passem de 272K e trate qualquer aumento como algo a testar. Faça seu próprio teste de recuperação com seus próprios documentos antes de confiar em contexto além de 256K.

Atualizaremos esta página quando a Context Arena ou outro avaliador independente publicar resultados do GPT-6 Sol por tamanho de contexto.

Fontes

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com