Kostenmodell für den Always-on-Agenten OpenAI O / AON
Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026
Durchgesickerte Hinweise enthüllen OpenAIs „O“ (Codename AON) – einen Always-on-Assistenten für Aufgaben mit langem Zeithorizont. Anders als Chat-Modelle, die antworten und dann stoppen, bekommt O eine eigene Cloud-Umgebung, kann Ausführungskontexte aufsetzen, Code schreiben, recherchieren und über Stunden, Tage oder womöglich Wochen durchgehend arbeiten. Dabei können mehrere Agenten an derselben Aufgabe miteinander kommunizieren. Erwartete Enthüllung: OpenAI Dev Day, 29. September 2026.
Was sich für die Kostenmodellierung ändert
Klassische LLM-Kosten: Tokens pro Anfrage × Preis. O/AON-Kosten: Zeit × zugewiesene Rechenleistung + Token-Durchsatz.
| Dimension | Chat-/Completion-API | O / AON (prognostiziert) |
|---|---|---|
| Abrechnungseinheit | Pro 1M Tokens | Pro Stunde (Rechenleistung) + pro 1M Tokens |
| Leerlaufkosten | $0 | >$0 (Umgebungsreservierung) |
| Maximale Dauer | Minuten (Timeout) | Tage/Wochen |
| Parallelität | Sequenzielle Anfragen | Multi-Agent-Schwärme |
| Zustand | Im Kontext übergeben | Persistente Umgebung |
Prognostiziertes Kostenmodell (spekulativ, basierend auf Leak-Mustern)
OpenAI hat keine Preise veröffentlicht. Zwei wahrscheinliche Strukturen:
Option A: Rechenstunde + Tokens (wie bei Codespaces)
- Umgebungsreservierung: ~$0.50-2.00/Stunde (CPU + Arbeitsspeicher + Speicher)
- Token-Durchsatz: Standard-Tarife von GPT-5 obendrauf
- Ultra-fast-Stufe: 5-10x Token-Multiplikator, wenn aktiviert
Ein 24-Stunden-Agentenlauf mit 5M Eingabe- / 2M Ausgabe-Tokens:
| Komponente | Kosten (niedrig) | Kosten (hoch) |
|---|---|---|
| 24h-Umgebung ($1/h) | $24 | $48 |
| 5M Eingabe à $5/MTok | $25 | $25 |
| 2M Ausgabe à $15/MTok | $30 | $30 |
| Gesamt | $79 | $103 |
Option B: Pauschalabo (Pro-Max-Paket)
- ChatGPT Pro Max für $500/Monat enthält O/AON-Zugang + Ultra-fast-Kontingent
- Effektiv pro Stunde: $500 / 720 h = $0.69/h (bei 24/7-Betrieb)
- Break-even gegenüber Option A: ~15 Stunden/Tag Dauernutzung
Kostenoptimierung für Always-on-Agenten
- Hibernieren statt beenden. Wenn die Umgebung bestehen bleibt, pausieren Sie die Agentenschleife in Leerlaufphasen, statt sie herunterzufahren – ein Kaltstart kostet mehr als die Leerlaufreservierung.
- Subtask-Tokens bündeln. Sammeln Sie Subtask-Ergebnisse und schreiben Sie den Kontext in größeren Blöcken, um die Cache-Trefferquote in der persistenten Umgebung zu verbessern.
- Subtasks an günstigere Modelle routen. O/AON orchestriert; delegieren Sie Coding an Sonnet 5.5, Recherche an Flash-Modelle und eskalieren Sie nur für kritische Entscheidungen auf Premium.
- Harte Zeit- und Geldbudgets pro Ziel setzen. „Löse diesen Bug, max. $10 / 2 Stunden“ – über den Orchestrator durchsetzen, nicht auf Hoffnung bauen.
Wann O/AON, wann lang laufendes Opus 5.5?
- O/AON: mehrtägige Recherche, kontinuierliches Monitoring, Multi-Agent-Koordination, Aufgaben mit persistentem Umgebungszustand
- Opus-5.5-Agentenschleife: Coding-Aufgaben mit einem einzigen Ziel (Stunden, nicht Tage), klar definierte Ergebnisse, Ausführung in einem Durchgang
Weiterführende Lektüre
Siehe Wirtschaftlichkeit von ChatGPT Pro Max, OpenAI Ultra Fast API-Preise, Kosten von 25 Stunden Opus-5.5-Agent und Agent Economics.
Weiterführend
- Wirtschaftlichkeit von ChatGPT Pro Max
- OpenAI Ultra Fast API-Preise
- Kosten von 25 Stunden Opus-5.5-Agent
- Agent Economics
Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →