Zum Inhalt springen

Kostenmodell für den Always-on-Agenten OpenAI O / AON

Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026

Durchgesickerte Hinweise enthüllen OpenAIs „O“ (Codename AON) – einen Always-on-Assistenten für Aufgaben mit langem Zeithorizont. Anders als Chat-Modelle, die antworten und dann stoppen, bekommt O eine eigene Cloud-Umgebung, kann Ausführungskontexte aufsetzen, Code schreiben, recherchieren und über Stunden, Tage oder womöglich Wochen durchgehend arbeiten. Dabei können mehrere Agenten an derselben Aufgabe miteinander kommunizieren. Erwartete Enthüllung: OpenAI Dev Day, 29. September 2026.

Was sich für die Kostenmodellierung ändert

Klassische LLM-Kosten: Tokens pro Anfrage × Preis. O/AON-Kosten: Zeit × zugewiesene Rechenleistung + Token-Durchsatz.

DimensionChat-/Completion-APIO / AON (prognostiziert)
AbrechnungseinheitPro 1M TokensPro Stunde (Rechenleistung) + pro 1M Tokens
Leerlaufkosten$0>$0 (Umgebungsreservierung)
Maximale DauerMinuten (Timeout)Tage/Wochen
ParallelitätSequenzielle AnfragenMulti-Agent-Schwärme
ZustandIm Kontext übergebenPersistente Umgebung

Prognostiziertes Kostenmodell (spekulativ, basierend auf Leak-Mustern)

OpenAI hat keine Preise veröffentlicht. Zwei wahrscheinliche Strukturen:

Option A: Rechenstunde + Tokens (wie bei Codespaces)

Ein 24-Stunden-Agentenlauf mit 5M Eingabe- / 2M Ausgabe-Tokens:

KomponenteKosten (niedrig)Kosten (hoch)
24h-Umgebung ($1/h)$24$48
5M Eingabe à $5/MTok$25$25
2M Ausgabe à $15/MTok$30$30
Gesamt$79$103

Option B: Pauschalabo (Pro-Max-Paket)

Kostenoptimierung für Always-on-Agenten

  1. Hibernieren statt beenden. Wenn die Umgebung bestehen bleibt, pausieren Sie die Agentenschleife in Leerlaufphasen, statt sie herunterzufahren – ein Kaltstart kostet mehr als die Leerlaufreservierung.
  2. Subtask-Tokens bündeln. Sammeln Sie Subtask-Ergebnisse und schreiben Sie den Kontext in größeren Blöcken, um die Cache-Trefferquote in der persistenten Umgebung zu verbessern.
  3. Subtasks an günstigere Modelle routen. O/AON orchestriert; delegieren Sie Coding an Sonnet 5.5, Recherche an Flash-Modelle und eskalieren Sie nur für kritische Entscheidungen auf Premium.
  4. Harte Zeit- und Geldbudgets pro Ziel setzen. „Löse diesen Bug, max. $10 / 2 Stunden“ – über den Orchestrator durchsetzen, nicht auf Hoffnung bauen.

Wann O/AON, wann lang laufendes Opus 5.5?

Weiterführende Lektüre

Siehe Wirtschaftlichkeit von ChatGPT Pro Max, OpenAI Ultra Fast API-Preise, Kosten von 25 Stunden Opus-5.5-Agent und Agent Economics.

Weiterführend


Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →

Zurück zu finopsllm.com