Modelo de custo do quadro de mensagens de agentes da OpenAI
Atualizado September 27, 2026 · publicado originalmente September 27, 2026
Em setembro de 2026, pesquisadores descobriram um quadro de mensagens de agentes da OpenAI: uma camada de comunicação em que agentes autônomos podem postar mensagens, ler respostas e coordenar fluxos de trabalho de várias etapas sem intervenção humana. Para as equipes de FinOps, isso introduz um novo vetor de custo: o consumo de tokens entre agentes, que escala com a duração da conversa, e não com a complexidade da tarefa.
O que o quadro de mensagens permite
O quadro funciona como um barramento de contexto compartilhado. Um agente orquestrador posta a decomposição da tarefa; agentes especialistas assumem subtarefas, postam resultados e negociam repasses. Cada mensagem é um ciclo completo de prompt e resposta, cobrado pelas tarifas padrão do modelo.
Modelo de custo
| Componente | Tarifa (GPT-6 Astra) | Tarifa (GPT-6 Sol) |
|---|---|---|
| Postagem do agente (entrada) | $10.00 / 1M | $2.00 / 1M |
| Leitura do agente (entrada em cache) | $1.00 / 1M | $0.20 / 1M |
| Resposta do agente (saída) | $50.00 / 1M | $10.00 / 1M |
Uma coordenação de 10 turnos entre três agentes com preços do Astra: ~300K tokens = $15. A mesma troca no Sol: $3. A diferença está em saber se a tarefa exige o raciocínio do Astra ou se os tokens mais baratos do Sol bastam.
Cenários de descontrole
- Loops de negociação: dois agentes discordam sobre um repasse e iteram mais de 50 vezes antes de convergir.
- Tempestades de broadcast: um agente posta para todos os assinantes; cada um responde, disparando mais postagens.
- Conversas órfãs: os agentes aguardam uma resposta que nunca chega e consultam o quadro a cada 30 segundos.
Controles de FinOps
- Orçamento de mensagens por fluxo de trabalho: teto rígido de tokens totais do quadro por ID de tarefa.
- Limites de profundidade: no máximo 3 saltos entre agentes antes de escalar para uma pessoa.
- Roteamento de modelos: direcione a coordenação para o Sol; reserve o Astra apenas para a etapa final de síntese.
- Timeout de inatividade: fechar threads automaticamente após 5 minutos sem atividade.
Conclusão
O quadro de mensagens torna os sistemas multiagente componíveis, mas composição sem proteções de custo é um vazamento de orçamento. Trate os tokens entre agentes como um centro de custo distinto, com alertas e orçamentos próprios.
Artigos relacionados
- Modelo de custo do GPT-6 Astra
- Modelo de custo do GPT-6 Sol
- Limites de concorrência no fan-out de subagentes
- Três orçamentos de agentes
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →