Saltar para o conteúdo

Modelo de custo do agente sempre ativo OpenAI O / AON

Atualizado September 27, 2026 · publicado originalmente September 27, 2026

Referências vazadas revelam o «O» da OpenAI (codinome AON), um assistente sempre ativo projetado para tarefas de longo horizonte. Ao contrário dos modelos de chat, que respondem e param, o O tem seu próprio ambiente em nuvem, pode montar contextos de execução, escrever código, pesquisar e operar continuamente por horas, dias ou até semanas. Pode envolver vários agentes se comunicando na mesma tarefa. Revelação esperada: OpenAI Dev Day, 29 de setembro de 2026.

O que muda na modelagem de custos

Custo tradicional de LLM: tokens por requisição × tarifa. Custo do O/AON: tempo × computação alocada + vazão de tokens.

DimensãoAPI de chat/completionsO / AON (projetado)
Unidade de cobrançaPor 1M de tokensPor hora (computação) + por 1M de tokens
Custo em ociosidade$0>$0 (reserva do ambiente)
Duração máximaMinutos (timeout)Dias/semanas
ParalelismoRequisições sequenciaisEnxames multiagente
EstadoPassado no contextoAmbiente persistente

Modelo de custo projetado (especulativo, com base em padrões dos vazamentos)

A OpenAI não publicou preços. Duas estruturas prováveis:

Opção A: hora de computação + tokens (como o Codespaces)

Uma execução de agente de 24 horas com 5M de tokens de entrada / 2M de saída:

ComponenteCusto (baixo)Custo (alto)
Ambiente 24 h ($1/h)$24$48
5M de entrada a $5/MTok$25$25
2M de saída a $15/MTok$30$30
Total$79$103

Opção B: assinatura fixa (pacote Pro Max)

Estratégias de otimização de custos para agentes sempre ativos

  1. Hibernar, não encerrar. Se o ambiente persiste, pause o loop do agente nos períodos ociosos em vez de desligá-lo: a partida a frio custa mais do que a reserva em ociosidade.
  2. Agrupar os tokens das subtarefas. Acumule os resultados das subtarefas e grave o contexto em blocos maiores para melhorar a taxa de acerto do cache no ambiente persistente.
  3. Rotear subtarefas para modelos mais baratos. O O/AON orquestra; delegue a programação ao Sonnet 5.5, a pesquisa aos modelos Flash e só escale para um modelo premium em decisões críticas.
  4. Definir orçamentos rígidos de tempo e dinheiro por objetivo. «Resolva este bug, máx. $10 / 2 horas»: imponha pelo orquestrador, não na esperança.

Quando usar O/AON e quando usar o Opus 5.5 de longa duração

Leituras relacionadas

Veja economia do ChatGPT Pro Max, preços da API Ultra Fast da OpenAI, custo de 25 horas de agente com Opus 5.5 e economia de agentes.

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com