Saltar para o conteúdo

Auto-compact do Codex no GPT-6 Sol: os padrões no código-fonte e o que custa aumentá-los

Atualizado September 27, 2026 · publicado originalmente September 27, 2026

Resposta rápida: O Codex auto-compacta uma sessão do GPT-6 Sol em 244.800 tokens: 90% da janela de 272.000 tokens que ele atribui ao modelo. Aumentar model_auto_compact_token_limit acima desse número não faz nada se...

O Codex auto-compacta uma sessão do GPT-6 Sol em 244.800 tokens: 90% da janela de 272.000 tokens que ele atribui ao modelo. Aumentar model_auto_compact_token_limit acima desse número não faz nada se você não aumentar também model_context_window. Se você aumentar a janela além de 272K, cada turno que cruza a linha é cobrado com tarifas de contexto longo. Lemos os números no código-fonte do Codex 0.157.1 e no catálogo de modelos que o Codex baixa.

Que janela de contexto o Codex dá ao GPT-6 Sol?

272.000 tokens, embora a API aceite até 922.000. O Codex baixa um catálogo de modelos e o guarda em cache em ~/.codex/models_cache.json. A entrada de gpt-6-sol lista um context_window de 272.000 e um max_context_window de 872.000. Também define effective_context_window_percent como 95 e deixa auto_compact_token_limit vazio. O GPT-6 Astra e o GPT-6 Luna têm os mesmos valores.

272K não é um número arbitrário. É exatamente onde começa o preço de contexto longo do GPT-6.

ValorTokensDe onde vem
Janela de contexto272.000context_window no catálogo de modelos
Janela utilizável258.40095% da janela (effective_context_window_percent)
Limite de auto-compact244.80090% da janela, calculado no código
Maior janela permitida872.000max_context_window no catálogo de modelos
Limite de entrada da API922.000Especificação do modelo da OpenAI (1,05M no total com a saída)

Como o Codex decide quando compactar?

Ele pega o menor entre o seu limite configurado e 90% da janela de contexto. Em codex-rs/protocol/src/openai_models.rs, auto_compact_token_limit() calcula context_window * 9 / 10. Ela devolve esse valor ou o seu limite configurado, o que for menor. O catálogo não traz limite para o GPT-6 Sol, então por padrão o resultado é 272.000 × 0,9 = 244.800.

Assim, a configuração só pode antecipar a compactação. Coloque model_auto_compact_token_limit = 300000 no config.toml com a janela padrão, e o Codex continua compactando em 244.800 sem nenhum aviso. Para compactar mais tarde, você também precisa aumentar model_context_window, e isso move o teto também: no máximo de 872.000, o limite padrão passa a ser 784.800.

Uma segunda configuração, model_auto_compact_token_limit_scope, vale total por padrão, que conta todo o contexto ativo. A alternativa, body_after_prefix, conta apenas o que a conversa acrescenta depois do contexto que ela trazia de antes.

Quanto custa aumentar a janela do Codex além de 272K?

Por turno, muito mais do que os tokens extras. Quando uma requisição ao GPT-6 Sol passa de 272K tokens de entrada, a requisição inteira é cobrada com tarifas de contexto longo. A entrada e a entrada em cache custam o dobro, e a saída custa 1,5 vez mais. Numa sessão longa de agente, quase todo turno reenvia o histórico inteiro, então a maior parte dessa entrada é prefixo em cache.

Contexto por turnoTarifa de entrada em cacheCusto do contexto em cache por turnoCusto sem cache por turno
240K (compacta no padrão)$0,20 / 1M$0,048$0,48
270K$0,20 / 1M$0,054$0,54
300K (janela aumentada)$0,40 / 1M$0,12$1,20
400K (janela aumentada)$0,40 / 1M$0,16$1,60

Ir de 270K para 300K acrescenta 11% de tokens e multiplica por 2,2 o custo de cada turno. Num plano do ChatGPT você não vê uma fatura, mas os mesmos tokens contam contra os seus limites do Codex de 5 horas e semanais, então uma janela maior os esgota mais rápido. O texto context-window-paid-twice explica por que essa cobrança repetida domina as sessões longas.

O GPT-6 Sol continua preciso perto de 244K tokens?

Ninguém mediu isso ainda. A única pontuação independente de contexto longo do GPT-6 Sol é o AA-LCR da Artificial Analysis: 84%, igual ao GPT-5.6 Sol. Os documentos desse teste têm em média cerca de 100K tokens. Os números de MRCR citados para o “Sol” em 256K–512K pertencem ao GPT-5.6 Sol. Nosso resumo dos benchmarks de contexto longo do GPT-6 Sol lista o que foi e o que não foi publicado até 27 de setembro de 2026.

O que você deve configurar?

Para a maioria das equipes, nada. O padrão já é a escolha segura em custo. Compactar em 244.800 mantém cada requisição abaixo da linha de preço de 272K, com folga para a saída. Três situações pedem uma mudança:

# ~/.codex/config.toml
model = "gpt-6-sol"
model_context_window = 272000          # pin the default window, below the 272K price line
model_auto_compact_token_limit = 240000 # anything above 244,800 is ignored at this window

Fontes

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com