Ga naar inhoud

Kostenmodel van de OpenAI O / AON always-on agent

Bijgewerkt September 27, 2026 · eerst gepubliceerd September 27, 2026

Gelekte verwijzingen onthullen OpenAI's 'O' (codenaam AON) — een always-on assistent ontworpen voor taken met een lange horizon. In tegenstelling tot chatmodellen die antwoorden en stoppen, krijgt O een eigen cloudomgeving, kan uitvoeringscontexten opzetten, code schrijven, onderzoek doen en continu werken gedurende uren, dagen of mogelijk weken. Meerdere agents kunnen aan dezelfde taak communiceren. Verwachte onthulling: OpenAI Dev Day, 29 september 2026.

Wat verandert er voor kostenmodellering

Traditionele LLM-kosten: tokens per request × tarief. O/AON-kosten: tijd × toegewezen compute + tokendoorvoer.

DimensieChat/Completion APIO / AON (geprojecteerd)
FactureringseenheidPer 1M tokensPer uur (compute) + per 1M tokens
Kosten bij inactiviteit$0>$0 (reservering van de omgeving)
Maximale duurMinuten (timeout)Dagen/weken
ParallellismeOpeenvolgende requestsMulti-agentzwermen
StateMeegegeven in contextPersistente omgeving

Geprojecteerd kostenmodel (speculatief, gebaseerd op lekpatronen)

OpenAI heeft geen prijzen gepubliceerd. Twee waarschijnlijke structuren:

Optie A: computeuur + tokens (zoals Codespaces)

Een agentrun van 24 uur met 5M input / 2M outputtokens:

ComponentKosten (laag)Kosten (hoog)
24 uur omgeving ($1/uur)$24$48
5M input @ $5/MTok$25$25
2M output @ $15/MTok$30$30
Totaal$79$103

Optie B: vast abonnement (Pro Max-bundel)

Kostenoptimalisatiestrategieën voor always-on agents

  1. Hiberneer, beëindig niet. Als de omgeving blijft bestaan, pauzeer dan de agentloop tijdens inactieve perioden in plaats van af te sluiten — een koude start kost meer dan een inactieve reservering.
  2. Bundel tokens van subtaken. Verzamel resultaten van subtaken en schrijf context in grotere brokken om de cachetreffer-ratio op de persistente omgeving te verbeteren.
  3. Route subtaken naar goedkopere modellen. O/AON orkestreert; delegeer codering aan Sonnet 5.5, onderzoek aan Flash-modellen en escaleer alleen naar premium voor kritieke beslissingen.
  4. Stel harde tijd-/geldbudgetten per doel. 'Los deze bug op, max $10 / 2 uur' — dwing af via de orchestrator, hoop niet.

Wanneer O/AON versus de langlopende Opus 5.5

Verwante lectuur

Zie economie van ChatGPT Pro Max, prijzen van de OpenAI Ultra Fast API, kosten van de 25-uurs Opus 5.5-agent en agenteconomie.

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com