Zum Inhalt springen

GPT-6 Luna Kostenmodell

Aktualisiert September 23, 2026 · erstveröffentlicht September 23, 2026

GPT-6 Luna ist das günstige Modell der GPT-6-Familie von OpenAI und erschien am 22. September 2026 zusammen mit GPT-6 Sol. OpenAI richtet es mit einem klaren Ziel an Hochvolumen-Aufgaben: Zusammenfassen, Extrahieren und schnelle Fragen. Mit $0.10 pro 1M Input-Tokens ist es das Modell, auf das man zuerst routet und das man erst verlässt, wenn die Aufgabe beweist, dass sie mehr braucht.

Preise von GPT-6 Luna

StufeInputGecachter InputOutput
Standard$0.10$0.01$0.50
Batch oder Flex$0.05$0.005$0.25
Fast-Modus$0.20$0.02$1.00
Langer Kontext (über 272K Input)$0.20$0.02$0.75

Pro 1M Tokens, laut Preisseite von OpenAI. Ein Cache-Schreibvorgang kostet $0.125. Luna hat dasselbe Kontextfenster von 1,050,000 Tokens wie der Rest von GPT-6, einen Wissensstand von Mai 2026 (den aktuellsten der drei) und den vollen Effort-Bereich von none bis max.

Gleicher Wert wie GPT-5.6 Luna, 61 % günstiger pro Aufgabe

Artificial Analysis hat beide Luna-Generationen mit seinem Intelligence Index (v4.3.2) bei maximalem Effort getestet.

ModellIndex-WertKosten pro AufgabeAusgabegeschwindigkeit
GPT-6 Luna (max)37$0.07132.2 Tokens/s
GPT-5.6 Luna (max)37$0.18142.3 Tokens/s
GPT-6 Sol (low)33.9$0.13—

Der Wert hat sich nicht bewegt. Die Kosten pro Aufgabe sanken um 61 %, vor allem durch den niedrigeren Preis pro Token. GPT-6 Luna auf max schlägt außerdem GPT-6 Sol auf low sowohl beim Wert als auch bei den Kosten. Wenn Sie Sol auf low betrieben haben, um zu sparen, ist Luna auf max bei diesem Index das bessere Angebot.

Was hohes Volumen kostet

Eine Million Klassifizierungsanfragen pro Monat, jede mit 600 Input-Tokens und 100 Output-Tokens, ohne Caching:

ModellMonatliche Kosten
GPT-6 Luna, Batch$55
GPT-6 Luna$110
GPT-5.6 Luna$240
Claude Haiku 4.5$1,100
GPT-6 Sol$2,200
GPT-6 Astra$11,000

Claude Haiku 4.5 kostet pro Token 10× mehr und erreichte als Modell ohne Reasoning nur 15 im selben Index. Dieselbe Arbeit von Sol auf Luna zu verlagern senkt die Rechnung um 95 %. Deshalb lohnt sich ein Router, der nur die schwierigen Fälle an Sol schickt.

Der Haken: Latenz und Ausführlichkeit

Die obigen Indexwerte gelten für maximalen Effort, und bei maximalem Effort startet Luna langsam. Artificial Analysis maß 104 Sekunden bis zum ersten Token. Außerdem verbrauchte das Modell über den gesamten Index 150M Output-Tokens, bei einem Median von 84M; Artificial Analysis beschreibt es als eher wortreich. Diese Ausführlichkeit steckt bereits in den $0.07 pro Aufgabe, die Kostenzahl stimmt also, aber die Wartezeit eignet sich nicht für einen nutzernahen Chat.

Für interaktiven Traffic betreiben Sie Luna mit none, low oder dem Standard medium und messen die Genauigkeit an Ihren eigenen Prompts. Die Werte auf dieser Seite gelten nur für maximalen Effort; die Genauigkeit bei niedrigeren Einstellungen müssen Sie testen, nicht nachschlagen. Heben Sie sich maximalen Effort für Batch-Jobs auf, bei denen Latenz keine Rolle spielt und der Batch-Preis die Rechnung nochmals halbiert.

Rate Limits skalieren weiter als bei Sol

Luna beginnt in Tier 1 mit 500K Tokens pro Minute, genau wie Sol, erreicht aber in Tier 5 180M Tokens pro Minute (Sol endet bei 40M), mit bis zu 30,000 Anfragen pro Minute. Für Bulk-Pipelines zählt dieser Spielraum so viel wie der Preis.

So setzen Sie Luna ein

Quellen: OpenAI-Modellseite zu GPT-6 Luna, Artificial Analysis: GPT-6 Luna, Artificial Analysis: GPT-5.6 Luna, TechCrunch. Preise abgerufen am 23. September 2026.

Weiterführend


Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →

Zurück zu finopsllm.com