Vai al contenuto

Modello di costo dell'agente sempre attivo OpenAI O / AON

Aggiornato September 27, 2026 · pubblicato inizialmente September 27, 2026

Riferimenti trapelati rivelano la “O” di OpenAI (nome in codice AON): un assistente sempre attivo progettato per attività di lungo orizzonte. A differenza dei modelli di chat, che rispondono e si fermano, O ottiene un proprio ambiente cloud, può predisporre contesti di esecuzione, scrivere codice, fare ricerca e operare in modo continuo per ore, giorni o potenzialmente settimane. Potrebbe coinvolgere più agenti che comunicano sulla stessa attività. Presentazione prevista: OpenAI Dev Day, 29 settembre 2026.

Cosa cambia per la modellazione dei costi

Costo LLM tradizionale: token per richiesta × tariffa. Costo di O/AON: tempo × calcolo allocato + throughput di token.

DimensioneAPI Chat/CompletionsO / AON (previsto)
Unità di fatturazionePer 1M di tokenPer ora (calcolo) + per 1M di token
Costo a riposo$0>$0 (riserva dell'ambiente)
Durata massimaMinuti (timeout)Giorni/settimane
ParallelismoRichieste sequenzialiSciami multi-agente
StatoPassato nel contestoAmbiente persistente

Modello di costo previsto (speculativo, basato sui pattern dei leak)

OpenAI non ha pubblicato prezzi. Due strutture probabili:

Opzione A: ore di calcolo + token (come Codespaces)

Un'esecuzione di agente di 24 ore con 5M di token di input e 2M di output:

ComponenteCosto (basso)Costo (alto)
Ambiente 24 h ($1/h)$24$48
5M di input a $5/MTok$25$25
2M di output a $15/MTok$30$30
Totale$79$103

Opzione B: abbonamento forfettario (pacchetto Pro Max)

Strategie di ottimizzazione dei costi per gli agenti sempre attivi

  1. Ibernare, non terminare. Se l'ambiente persiste, sospendete il ciclo dell'agente nei periodi di inattività invece di spegnerlo: un avvio a freddo costa più della riserva a riposo.
  2. Raggruppate i token delle sottoattività. Accumulate i risultati delle sottoattività e scrivete il contesto in blocchi più grandi per migliorare il tasso di hit della cache sull'ambiente persistente.
  3. Instradate le sottoattività verso modelli più economici. O/AON orchestra; delegate il coding a Sonnet 5.5, la ricerca ai modelli Flash e passate a un modello premium solo per le decisioni critiche.
  4. Fissate budget rigidi di tempo e denaro per obiettivo. “Risolvi questo bug, massimo $10 / 2 ore”: applicatelo tramite l'orchestratore, senza affidarvi alla speranza.

Quando usare O/AON e quando Opus 5.5 a esecuzione lunga

Letture correlate

Vedete economia di ChatGPT Pro Max, prezzi dell'API Ultra Fast di OpenAI, costo di 25 ore di agente con Opus 5.5 e economia degli agenti.

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com