Kostenmodell der OpenAI Decisions API: Preis nur auf Input und schnelle typisierte Outputs
Aktualisiert October 7, 2026 · erstveröffentlicht October 7, 2026
Die Decisions API von OpenAI ist ein Beta-Endpunkt, der gemeinsame Text- oder Bildbelege in typisierte Klassifikationen, Auswahlentscheidungen oder Scores umwandelt. Mit GPT-6 Luna kostet sie $0.10 pro Million Input-Tokens und berechnet weder Cache- noch Output-Tokens. Betrachten Sie die Aussage „10x schneller“ als Latenzsignal und testen Sie dann Qualität und Gesamtkosten pro Aufgabe an Ihrer eigenen Workload.
Was hat OpenAI am 6. Oktober 2026 veröffentlicht?
OpenAI hat die Decisions API am 6. Oktober 2026 als öffentliche Beta eingeführt. Der eigene Decisions-Leitfaden besagt, dass sie typisierte Antworten etwa 10-mal schneller liefert als die Responses API. Zum Start ist GPT-6 Luna das einzige unterstützte Modell, und Anfragen nutzen POST /v1/decisions. Der Geschwindigkeitsvergleich ist eine von OpenAI veröffentlichte Behauptung, kein Versprechen, dass jede Anwendung dieselbe Ende-zu-Ende-Verbesserung erlebt.
Eine Anfrage enthält einen gemeinsamen Input und eine oder mehrere Fragen. Jede Frage kann ein Prädikat (die Wahrscheinlichkeit, dass eine Bedingung zutrifft), eine Auswahl aus einer vorgegebenen Menge oder einen Score gegen geordnete Stufen verlangen. Der Endpunkt liefert diese Antworten in typisierter Form mit Wahrscheinlichkeiten oder Konfidenzangaben. Das eignet sich für abgegrenzte Entscheidungen wie das Routing eines Support-Tickets, das Markieren wahrscheinlicher Schäden auf einem Produktfoto oder das Bewerten des Schweregrads eines Vorfalls.
Wie funktioniert die Abrechnung der Decisions API?
Für den Decisions-Endpunkt nennt OpenAI mit GPT-6 Luna $0.10 pro Million Input-Tokens. Laut Leitfaden werden nur Input-Tokens berechnet: Gebühren für Cache-Lesen, Cache-Schreiben und Output-Tokens entfallen. Das unterscheidet sich von einer gewöhnlichen GPT-6-Luna-Responses-Anfrage, bei der die Standardtarife für kurzen Kontext $0.10 pro Million nicht gecachter Input-Tokens, $0.01 für gecachten Input, $0.125 für Cache-Schreibvorgänge und $0.50 für Output-Tokens betragen. Verwenden Sie für diesen Endpunkt die eigenen Decisions-Preisbedingungen, nicht die vollständige Preisliste des Modells.
Hier eine hypothetische Schätzung, vor etwaigen regionalen oder Langkontext-Anpassungen: Wenn eine durchschnittliche Anfrage 1,200 Input-Tokens nutzt, beträgt ihre Token-Gebühr 1,200 ÷ 1,000,000 × $0.10 = $0.00012. Eine Million solcher Anfragen würde 1.2 Milliarden Input-Tokens verbrauchen und rund $120 kosten. Das ist ein Planungsbeispiel, kein Angebot; messen Sie die tatsächliche Token-Nutzung und prüfen Sie den aktuellen Tarif, bevor Sie ein Budget festlegen.
Da Output-Tokens hier keine abgerechnete Kategorie sind, zählen Sie den gesamten Input sorgfältig: die Belege, den in der Anfrage enthaltenen Systemkontext sowie die Anweisungen und Auswahloptionen jeder Frage. Stellen Sie unabhängige Fragen zum selben Input, wo es sinnvoll ist, in einer einzigen Anfrage. OpenAI dokumentiert, dass unabhängige Fragen Belege gemeinsam nutzen können; Fragen, die von früheren Antworten abhängen, sollten in separaten Aufrufen gesendet werden. Halten Sie Fragen kurz und beobachtbar, damit die Anfrage keine Tokens für mehrdeutige Bewertungsraster verbraucht.
Wann sollte ein Team Decisions statt Responses verwenden?
Nutzen Sie Decisions, wenn das Ergebnis von Natur aus begrenzt ist: „Ist dieses Bild sichtbar beschädigt?“, „Welche dieser drei Queues ist für dieses Ticket zuständig?“ oder „Wie schwerwiegend ist dieser Vorfall gemessen an diesen expliziten Stufen?“. Es liefert eine Antwort, die die Anwendung routen oder zählen kann, ohne ein universelles Modell einen Absatz schreiben zu lassen und diesen Text anschließend zu parsen.
Behalten Sie Responses für Aufgaben, die Erklärungen, beliebige JSON-Schemata, generierten Text, Tool-Aufrufe oder eine Entscheidung im Dialog mit dem Modell erfordern. Der OpenAI-Leitfaden verweist Entwickler ausdrücklich auf Structured Outputs, wenn sie ein benutzerdefiniertes JSON-Objekt benötigen, und auf Function Calling, wenn das Modell einen Tool-Aufruf anfordern soll. Eine typisierte Auswahl ersetzt weder eine begründete Erklärung noch eine ausführbare Aktion.
Der richtige Vergleich sind die Kosten pro korrektem Geschäftsergebnis, nicht Tokens oder Latenz isoliert. Ein schneller Klassifikator, der teure Falsch-Positive erzeugt, kann den Prüfaufwand erhöhen. Ein Endpunkt mit niedrigem Preis kann dennoch verlieren, wenn Teams mit wiederholten Prompts, manueller Prüfung oder nachgelagerter Korrektur gegensteuern. Verfolgen Sie die Nutzungs- und Antwortfelder der Decisions-Antwort, gleichen Sie Stichproben mit gelabelten Beispielen ab und beziehen Sie menschliche Prüfung und nachgelagerte Bearbeitung in die Kosten pro erfolgreich geroutetem Fall ein.
Wie kann FinOps die Einspar-Behauptung validieren?
- Wählen Sie eine abgegrenzte Workload. Nehmen Sie einen Klassifikations- oder Scoring-Schritt mit hohem Volumen, einer klaren Antwortmenge und messbaren Fehlerkosten.
- Erstellen Sie ein gelabeltes Testset. Messen Sie die Genauigkeit je Kategorie und prüfen Sie die Kalibrierung von Konfidenz bzw. Wahrscheinlichkeit. Legen Sie die Schwellen für die menschliche Prüfung anhand der Kosten von Falsch-Positiven und Falsch-Negativen fest, wie OpenAI empfiehlt.
- Führen Sie einen vergleichbaren Pilot durch. Vergleichen Sie den aktuellen Produktionspfad und Decisions mit gleichwertigen Inputs. Erfassen Sie Endpunkt-Latenz, Tokens, Wiederholungen, Prüfquote und die Kosten korrigierter Fehler.
- Budgetieren Sie die gesamte Route. Fügen Sie Speicher, Anwendungs-Compute, Reviewer-Zeit und spätere Responses- oder Tool-Aufrufe hinzu. Die Token-Preise von Decisions machen den Rest des Workflows nicht kostenlos.
- Halten Sie einen Ausstiegspfad offen. Der Endpunkt befindet sich in der öffentlichen Beta. Legen Sie Endpunkt und Modell in der Konfiguration fest, beobachten Sie das Changelog und testen Sie vor einem breiten Rollout erneut, wenn sich Verhalten oder Verfügbarkeit ändern.
OpenAI dokumentiert die Unterstützung von Zero Data Retention und die HIPAA-Nutzung für berechtigte Kunden sowie Datenresidenz-Optionen in den USA und Europa (EWR und Schweiz) mit Anforderungen an Berechtigung und Vereinbarung. Prüfen Sie diese Kontrollen anhand der tatsächlichen Konfiguration Ihrer Organisation, bevor Sie regulierte Daten in einen Pilot einbringen.
Was sollte ein Käufer zur Preisgestaltung der Decisions API festhalten?
Die Decisions API bietet eine neue Preis-und-Latenz-Kombination für kompakte, typisierte Entscheidungen: Zum veröffentlichten GPT-6-Luna-Tarif kostet Input $0.10 pro Million Tokens, und generierte Output-Tokens werden nicht berechnet. Die besten Kandidaten-Workloads haben wiederverwendbare Belege, klare Antworttypen und kostengünstige Wege, unsichere Ergebnisse abzufangen. Messen Sie Aufgabenqualität und gesamte Betriebskosten, bevor Sie Produktionsvolumen verlagern.
Welche verwandte Forschung sollten Teams lesen?
- Strukturierter Output ist nicht kostenlos
- Kosten pro erfolgreicher Aufgabe schlagen Kosten pro Anfrage
- Modellpreissenkungen senken Ihre KI-Rechnung nicht automatisch
Weiterführend
- Strukturierter Output ist nicht kostenlos
- Kosten pro erfolgreicher Aufgabe
- Modellpreissenkungen und Routing-Budgets
Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →