Auto-compact do Codex no GPT-6 Sol: os padrões no código-fonte e o que custa aumentá-los
Atualizado September 27, 2026 · publicado originalmente September 27, 2026
O Codex auto-compacta uma sessão do GPT-6 Sol em 244.800 tokens: 90% da janela de 272.000 tokens que ele atribui ao modelo. Aumentar model_auto_compact_token_limit acima desse número não faz nada se você não aumentar também model_context_window. Se você aumentar a janela além de 272K, cada turno que cruza a linha é cobrado com tarifas de contexto longo. Lemos os números no código-fonte do Codex 0.157.1 e no catálogo de modelos que o Codex baixa.
Que janela de contexto o Codex dá ao GPT-6 Sol?
272.000 tokens, embora a API aceite até 922.000. O Codex baixa um catálogo de modelos e o guarda em cache em ~/.codex/models_cache.json. A entrada de gpt-6-sol lista um context_window de 272.000 e um max_context_window de 872.000. Também define effective_context_window_percent como 95 e deixa auto_compact_token_limit vazio. O GPT-6 Astra e o GPT-6 Luna têm os mesmos valores.
272K não é um número arbitrário. É exatamente onde começa o preço de contexto longo do GPT-6.
| Valor | Tokens | De onde vem |
|---|---|---|
| Janela de contexto | 272.000 | context_window no catálogo de modelos |
| Janela utilizável | 258.400 | 95% da janela (effective_context_window_percent) |
| Limite de auto-compact | 244.800 | 90% da janela, calculado no código |
| Maior janela permitida | 872.000 | max_context_window no catálogo de modelos |
| Limite de entrada da API | 922.000 | Especificação do modelo da OpenAI (1,05M no total com a saída) |
Como o Codex decide quando compactar?
Ele pega o menor entre o seu limite configurado e 90% da janela de contexto. Em codex-rs/protocol/src/openai_models.rs, auto_compact_token_limit() calcula context_window * 9 / 10. Ela devolve esse valor ou o seu limite configurado, o que for menor. O catálogo não traz limite para o GPT-6 Sol, então por padrão o resultado é 272.000 × 0,9 = 244.800.
Assim, a configuração só pode antecipar a compactação. Coloque model_auto_compact_token_limit = 300000 no config.toml com a janela padrão, e o Codex continua compactando em 244.800 sem nenhum aviso. Para compactar mais tarde, você também precisa aumentar model_context_window, e isso move o teto também: no máximo de 872.000, o limite padrão passa a ser 784.800.
Uma segunda configuração, model_auto_compact_token_limit_scope, vale total por padrão, que conta todo o contexto ativo. A alternativa, body_after_prefix, conta apenas o que a conversa acrescenta depois do contexto que ela trazia de antes.
Quanto custa aumentar a janela do Codex além de 272K?
Por turno, muito mais do que os tokens extras. Quando uma requisição ao GPT-6 Sol passa de 272K tokens de entrada, a requisição inteira é cobrada com tarifas de contexto longo. A entrada e a entrada em cache custam o dobro, e a saída custa 1,5 vez mais. Numa sessão longa de agente, quase todo turno reenvia o histórico inteiro, então a maior parte dessa entrada é prefixo em cache.
| Contexto por turno | Tarifa de entrada em cache | Custo do contexto em cache por turno | Custo sem cache por turno |
|---|---|---|---|
| 240K (compacta no padrão) | $0,20 / 1M | $0,048 | $0,48 |
| 270K | $0,20 / 1M | $0,054 | $0,54 |
| 300K (janela aumentada) | $0,40 / 1M | $0,12 | $1,20 |
| 400K (janela aumentada) | $0,40 / 1M | $0,16 | $1,60 |
Ir de 270K para 300K acrescenta 11% de tokens e multiplica por 2,2 o custo de cada turno. Num plano do ChatGPT você não vê uma fatura, mas os mesmos tokens contam contra os seus limites do Codex de 5 horas e semanais, então uma janela maior os esgota mais rápido. O texto context-window-paid-twice explica por que essa cobrança repetida domina as sessões longas.
O GPT-6 Sol continua preciso perto de 244K tokens?
Ninguém mediu isso ainda. A única pontuação independente de contexto longo do GPT-6 Sol é o AA-LCR da Artificial Analysis: 84%, igual ao GPT-5.6 Sol. Os documentos desse teste têm em média cerca de 100K tokens. Os números de MRCR citados para o “Sol” em 256K–512K pertencem ao GPT-5.6 Sol. Nosso resumo dos benchmarks de contexto longo do GPT-6 Sol lista o que foi e o que não foi publicado até 27 de setembro de 2026.
O que você deve configurar?
Para a maioria das equipes, nada. O padrão já é a escolha segura em custo. Compactar em 244.800 mantém cada requisição abaixo da linha de preço de 272K, com folga para a saída. Três situações pedem uma mudança:
- Você quer compactar mais cedo, por exemplo porque threads longas começam a perder instruções anteriores. Reduza
model_auto_compact_token_limit, digamos para 200000. Valores abaixo de 244.800 têm efeito. - Você quer deixar os padrões atuais registrados para que uma futura atualização do catálogo não os mude em silêncio. Defina
model_context_window = 272000e um limite igual ou menor que 244.800. - Você precisa de mais de 258K de contexto ativo numa única sessão. Aumente
model_context_windowe aceite o preço de contexto longo em todo turno acima de 272K. Configure um alerta, porque nada na interface do Codex avisa sobre a mudança de preço.
# ~/.codex/config.toml
model = "gpt-6-sol"
model_context_window = 272000 # pin the default window, below the 272K price line
model_auto_compact_token_limit = 240000 # anything above 244,800 is ignored at this window
Fontes
- Código-fonte do Codex 0.157.1:
auto_compact_token_limit()eusable_context_window() - Código-fonte do Codex 0.157.1: sobrescritas de configuração aplicadas às informações do modelo
- Código-fonte do Codex 0.157.1: escopo da compactação e teto rígido de contexto
- Preços da API da OpenAI
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
Artigos relacionados
- Benchmarks de contexto longo do GPT-6 Sol: o que foi realmente medido
- Preços do GPT-6 e o salto de preço do contexto longo em 272K
- Você paga duas vezes pela janela de contexto
- Quanto de Codex o ChatGPT Pro inclui?
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →