Modelo de custo do agente sempre ativo OpenAI O / AON
Atualizado September 27, 2026 · publicado originalmente September 27, 2026
Referências vazadas revelam o «O» da OpenAI (codinome AON), um assistente sempre ativo projetado para tarefas de longo horizonte. Ao contrário dos modelos de chat, que respondem e param, o O tem seu próprio ambiente em nuvem, pode montar contextos de execução, escrever código, pesquisar e operar continuamente por horas, dias ou até semanas. Pode envolver vários agentes se comunicando na mesma tarefa. Revelação esperada: OpenAI Dev Day, 29 de setembro de 2026.
O que muda na modelagem de custos
Custo tradicional de LLM: tokens por requisição × tarifa. Custo do O/AON: tempo × computação alocada + vazão de tokens.
| Dimensão | API de chat/completions | O / AON (projetado) |
|---|---|---|
| Unidade de cobrança | Por 1M de tokens | Por hora (computação) + por 1M de tokens |
| Custo em ociosidade | $0 | >$0 (reserva do ambiente) |
| Duração máxima | Minutos (timeout) | Dias/semanas |
| Paralelismo | Requisições sequenciais | Enxames multiagente |
| Estado | Passado no contexto | Ambiente persistente |
Modelo de custo projetado (especulativo, com base em padrões dos vazamentos)
A OpenAI não publicou preços. Duas estruturas prováveis:
Opção A: hora de computação + tokens (como o Codespaces)
- Reserva do ambiente: ~$0.50-2.00/hora (CPU + memória + armazenamento)
- Vazão de tokens: tarifas padrão do GPT-5 por cima
- Camada ultra rápida: multiplicador de 5-10x nos tokens quando ativada
Uma execução de agente de 24 horas com 5M de tokens de entrada / 2M de saída:
| Componente | Custo (baixo) | Custo (alto) |
|---|---|---|
| Ambiente 24 h ($1/h) | $24 | $48 |
| 5M de entrada a $5/MTok | $25 | $25 |
| 2M de saída a $15/MTok | $30 | $30 |
| Total | $79 | $103 |
Opção B: assinatura fixa (pacote Pro Max)
- O ChatGPT Pro Max a $500/mês inclui acesso ao O/AON + cota ultra rápida
- Custo efetivo por hora: $500 / 720 h = $0.69/h (se rodar 24/7)
- Ponto de equilíbrio frente à Opção A: ~15 horas/dia de uso contínuo
Estratégias de otimização de custos para agentes sempre ativos
- Hibernar, não encerrar. Se o ambiente persiste, pause o loop do agente nos períodos ociosos em vez de desligá-lo: a partida a frio custa mais do que a reserva em ociosidade.
- Agrupar os tokens das subtarefas. Acumule os resultados das subtarefas e grave o contexto em blocos maiores para melhorar a taxa de acerto do cache no ambiente persistente.
- Rotear subtarefas para modelos mais baratos. O O/AON orquestra; delegue a programação ao Sonnet 5.5, a pesquisa aos modelos Flash e só escale para um modelo premium em decisões críticas.
- Definir orçamentos rígidos de tempo e dinheiro por objetivo. «Resolva este bug, máx. $10 / 2 horas»: imponha pelo orquestrador, não na esperança.
Quando usar O/AON e quando usar o Opus 5.5 de longa duração
- O/AON: pesquisa de vários dias, monitoramento contínuo, coordenação multiagente, tarefas que exigem estado de ambiente persistente
- Loop de agente com Opus 5.5: tarefas de programação com objetivo único (horas, não dias), entregáveis bem definidos, execução de uma só vez
Leituras relacionadas
Veja economia do ChatGPT Pro Max, preços da API Ultra Fast da OpenAI, custo de 25 horas de agente com Opus 5.5 e economia de agentes.
Artigos relacionados
- Economia do ChatGPT Pro Max
- Preços da API Ultra Fast da OpenAI
- Custo de 25 horas de agente com Opus 5.5
- Economia de agentes
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →