GPT-5.6-Preisschichten-Anleitung: Luna, Terra, Sol

Veröffentlicht 19. Juli 2026

OpenAI veröffentlichte GPT-5.6 am 10. Juli mit drei unterschiedlichen Preisschichten: Luna bei $1/$6 pro 1M Token, Terra bei $2,50/$15 und Sol bei $5/$30. Dies ist kein einfacher Geschwindigkeit/Qualität-Kompromiss; jede Schicht ist für eine andere Klasse von Arbeitsbelastung positioniert. Die Frage ist nicht "welche ist am besten" — es ist "welche ist richtig für diese Aufgabe?" Diese Anleitung ordnet Aufgaben Schichten zu, geht durchgerechnete Kostenbeispiele durch und zeigt Ihnen, wie Sie intelligent eskalieren, wenn eine günstigere Schicht nicht zuversichtlich genug ist.

Kritische Vorbemerkung: OpenAI positioniert Terra und Sol als äquivalente Reasoning-Fähigkeit aufweisend, die sich hauptsächlich in Geschwindigkeit und Durchsatz unterscheiden. Testen Sie beide gegen Ihre tatsächliche Arbeitsbelastung — die Paritätsansprüche halten nicht immer bei Ihrer Datenverteilung. Siehe GPT-5 vs. Alternativen für den Vergleich mit Claude und DeepSeek.

1. Die Drei Schichten: Geschwindigkeit, Kosten und Fähigkeit

Schicht Eingabe $/1M Ausgabe $/1M Cache-Lesevorgang $/1M Kontext Typische Latenz
Luna $1.00 $6.00 $0.10 128K 80–200 ms
Terra $2.50 $15.00 $0.25 128K 150–400 ms
Sol $5.00 $30.00 $0.50 128K 300–800 ms

Latenz ist wichtig: Luna ist am schnellsten, weil es für Streaming, Echtzeit-Klassifizierung und Durchsatz optimiert ist. Sol ist am langsamsten, weil es mehr internes Reasoning durchführt. Für interaktive benutzergerichtete Arbeitsbelastungen ist Luna auch günstiger und schneller — aber nur wenn es für Ihre Aufgabe leistungsfähig genug ist. Dies ist die Schlüssel-Routing-Entscheidung.

2. Aufgabentyp-Routing-Tabelle

Diese Tabelle ordnet häufige LLM-Aufgaben der Schicht zu, die die Kosten pro erfolgreicher Antwort minimiert:

Aufgabentyp Beispiel Empfohlene Schicht Erfolgsrate bei Schicht Geschätzte Kosten/1K Aufgaben
Klassifizierung Spam / Nicht-Spam; Stimmung (pos/neg/neutral) Luna 95–98% $1.20–$1.50
Strukturierte Extraktion Name, E-Mail, Telefon aus Text extrahieren Luna 92–96% $1.80–$2.40
Kategorisierung (viele Klassen) Einer von 50+ Produktkategorien zuordnen Luna 88–94% $2.40–$3.20
Zusammenfassung Artikel oder Chat-Protokoll kondensieren Luna 92–97% $1.50–$2.00
Agent-Schleifen (Tool-Nutzung) Multi-Turn: suchen, reasoning, verfeinern Terra 85–92% $8.00–$12.00
Multi-Turn-Konversation Kundensupport-Bots, Beratungs-Bots Terra 88–94% $6.00–$10.00
Code-Generierung (einfach) SQL-Abfrage, Bash-Snippet, Regex Terra 80–90% $10.00–$15.00
Code-Generierung (komplex) Vollständiger Endpoint, State Machine, DSL-Compiler Sol 75–88% $25.00–$40.00
Forschung + Synthese 10+ Papers analysieren, Konsens synthetisieren Sol 80–90% $30.00–$50.00
Schwieriges Reasoning (neuartiges Problem) Beweis-Verifikation, neuartige Algorithmen-Gestaltung Sol 70–85% $40.00–$70.00

Schlüsseleinsicht: Kosten pro Aufgabe sind nicht nur API-Kosten — es ist (API-Kosten) / (Erfolgsrate). Eine Luna-Klassifizierung mit 95% Erfolgsrate kostet ~$1,26 pro erfolgreiche Antwort. Falls Sie dieselbe Aufgabe zu Sol bei 98% Erfolgsrate routen, zahlen Sie ~$5,10 pro Antwort — aber Sie haben 3% mehr Ihrer Arbeitsbelastung gelöst, was den 4× Kosten möglicherweise wert ist oder nicht.

3. Durchgerechnete Kostenbeispiele Pro Aufgabe

Beispiel 1: Spam-Klassifizierung (Luna)

Aufgabe: E-Mail als Spam klassifizieren (binär Ja/Nein).

Typisches Token-Profil: 400 Eingabe (E-Mail) + 50 Ausgabe (Klassifizierung + Zuversicht) = 450 Token.

Luna-Kosten: (400 × $1/1M) + (50 × $6/1M) = $0,00043/Anfrage.

Falls 96% beim ersten Versuch erfolgreich: $0,00043 / 0,96 = $0,00045 pro erfolgreicher Klassifizierung.

Bei 1M E-Mails/Monat: $450/Monat (plus Cache-Rabatt, falls Sie System-Prompts wiederverwenden).

Falls fälschlicherweise zu Sol geroutet: (400 × $5 + 50 × $30) / 1M = $0,0025 pro Anfrage. Bei 98% Erfolg: $0,00255/Erfolg = $2.550/Monat (5,7× mehr).

Beispiel 2: Kundensupport-Agent (Terra)

Aufgabe: Multi-Turn-Supportkonversation mit Tool-Nutzung (Ticket-Suche, Policy-Suche, Eskalationsentscheidung).

Typisches Token-Profil pro Turn: 2.000 Eingabe (Kontext + Verlauf) + 400 Ausgabe (Antwort + Tool-Aufrufe) = 2.400 Token. Durchschnittlich 3 Turns zum Lösen = 7.200 Token gesamt pro Ticket.

Terra-Kosten: (2.000 × $2,50/1M) + (400 × $15/1M) = $0,0080/Turn oder $0,0240 pro Ticket.

Falls 90% ohne Eskalation gelöst: $0,0240 / 0,90 = $0,0267 pro erfolgreichen Ticket.

Bei 10K Tickets/Monat: $267/Monat.

Falls Luna stattdessen verwendet: (2.000 × $1 + 400 × $6) / 1M = $0,0044 pro Turn = $0,0132/Ticket. Aber Lunas Agent-Loop-Erfolg fällt auf 65% (Tool-Aufrufe versagen, Reasoning ist oberflächlich). Kosten pro Erfolg: $0,0132 / 0,65 = $0,0203. Nettoeinsparung: $29/Monat, aber 25% der Tickets schlagen fehl und eskalieren, erhöhen Supportkosten $400+. Luna funktioniert hier nicht.

Beispiel 3: Code-Generierung (Terra vs. Sol)

Aufgabe: Python-Funktion aus Anforderungsstring generieren.

Typisches Token-Profil: 1.500 Eingabe (Spezifikation + Beispiele) + 600 Ausgabe (Code + Erklärung) = 2.100 Token.

Terra-Kosten: (1.500 × $2,50 + 600 × $15) / 1M = $0,0134 pro Anfrage. Bei 85% Erfolg beim ersten Durchgang (Code kompiliert + besteht grundlegende Tests): $0,0158 pro funktionierende Funktion.

Sol-Kosten: (1.500 × $5 + 600 × $30) / 1M = $0,0255 pro Anfrage. Bei 90% Erfolg beim ersten Durchgang: $0,0283 pro funktionierende Funktion.

Einsparungen mit Terra: 44% günstiger pro funktionierendes Ergebnis. Verwenden Sie Sol nur, wenn der Unterschied von 5% in Erfolgsrate und Code-Qualität die nachgelagerten Debug-Kosten messbar reduziert.

4. Cascade- & Fallback-Routing-Muster

Die meisten FinOps-Teams sollten nicht eine einzelne Schicht für alle Arbeiten verwenden. Implementieren Sie stattdessen ein Cascade-Muster: Beginnen Sie mit der günstigsten Schicht, messen Sie Zuversicht, eskalieren Sie bei niedriger Zuversicht.

Schritt Modell Zuversichts-Schwellenwert Aktion falls Schwelle nicht erfüllt
1 Luna Zuversicht > 85% Ergebnis zurückgeben
2 Terra Zuversicht > 75% Ergebnis zurückgeben (eskaliert)
3 Sol Zuversicht > 60% Ergebnis zurückgeben oder explizit fehlschlagen
4 Menschliche Überprüfung An Mensch eskalieren

Echtes Szenario: Sie führen Dokumentenklassifizierung für Rechnungen durch (Klassifizierung nach Anbieter). Luna gibt hochzuversichtliche Ergebnisse zurück (~94% Erfolg) und kostet ~$1,20 pro 1K. Für die 6% mehrdeutiger Rechnungen, bei denen Luna Zuversicht < 85% zurückgibt, eskalieren Sie zu Terra (~94% Erfolg für schwierige Fälle), kostet ~$3,75 pro 1K Eskalationen. Falls 6% von 10K Dokumenten eskalieren: 600 × $3,75 = $2,25 extra, gesamt $12 + $2,25 = $14,25/10K. Reines Terra würde ~$37,50 kosten. Cascade spart 62% während die Genauigkeit bei Grenzfällen verbessert wird.

5. Prompt-Caching-Ökonomie

GPT-5.6 änderte Caching-Kosten: Cache-Schreibvorgänge kosten jetzt 1,25× die unkachedEingaberate (nicht kostenlos), und Cache-Lesevorgänge kosten 10% der Eingabe.

Szenario Präfix-Größe Schreibkosten Lesekosten (pro Treffer) Break-Even-Treffer Einsparungen @ 10 Treffer/Monat
Luna gecachte Abrufkontext 100K Token $0.125 $0.010 15 Treffer -$0.025 (Verlust)
Luna gecachter System-Prompt + Dokumente 50K Token $0.063 $0.005 8 Treffer $0.032
Terra gecachter Agent-Kontext 80K Token $0.250 $0.020 14 Treffer $0.030
Sol gecachter Reasoning-Kontext 100K Token $0.625 $0.050 13 Treffer $0.025

Wann zu cachen: Falls Ihr Prompt ein stabiles Präfix enthält (System-Anweisungen, Dokumentation, Few-Shot-Beispiele), das mehr als 5–10 mal in einem 30-Minuten-Fenster wiederverwendet wird, spart Caching üblicherweise Geld. Batch API (50% Rabatt) konkurriert jetzt mit Caching bei Kosten — falls Sie Dokumente im Batch klassifizieren, schlägt Batch-Rabatt die Caching-Kosten.

6. Vergleich mit Claude Sonnet 5, Gemini 3.1 Pro und DeepSeek V4

Modell Eingabe $/1M Ausgabe $/1M Geschwindigkeit Reasoning-Fähigkeit Wann zu wählen
GPT-5.6 Luna $1.00 $6.00 Schnell Anweisungsfolge, Routing Klassifizierung, Extraktion, Durchsatz
GPT-5.6 Terra $2.50 $15.00 Mittel Moderates Reasoning, Tool-Nutzung Agenten, Multi-Turn, mittlerer Code
GPT-5.6 Sol $5.00 $30.00 Langsam Frontier-Reasoning, Forschung Komplexer Code, schwieriges Reasoning, neuartige Probleme
Claude Sonnet 5 $2.00–$3.00 $10.00–$15.00 Mittel–Schnell Starkes Reasoning, lange Reasoning-Token Reasoning, Codierung (konkurrenzfähig mit Sol)
Gemini 3.1 Pro $2.00 $12.00 Mittel Multimodal, Forschungsfähigkeit Multimodale Aufgaben, konkurrenzfähig mit Terra
DeepSeek V4 Flash $0.14 $0.28 Sehr Schnell Basics-Reasoning, Cache-Fokus Hochvolumen-Routing, Cache-intensive Arbeitslasten (7–35× günstiger)

Kosten-Arbitrage: Für einfache Klassifizierung und Extraktion ist DeepSeek V4 Flash 7–20× günstiger als Luna. Testen Sie es gegen Ihre Daten — falls es 90%+ Genauigkeit erreicht, verwenden Sie es und sparen Sie den Unterschied. Claude Sonnet 5 ist 2× teurer als Terra, liefert aber stärkeres Reasoning pro Modell-Leistungsanspruch; verwenden Sie es, falls Ihr Terra-Benchmark unzureichende Qualität zeigt. Gemini 3.1 Pro landet zwischen Luna und Terra — nützlich, falls Sie Multimodal-Eingabe benötigen oder bereits im Vertex AI-Ökosystem sind.

7. Migration von GPT-5/5.5 & Deprecation-Status

OpenAI bietet weiterhin GPT-5.5 ($5/$30, gleich wie Sol) und GPT-5.4 ($2,50/$15, gleich wie Terra) zusammen mit GPT-5.6 an. Es gibt keinen Deprecation-Druck auf ältere Modelle — Sie können GPT-5.5 weiterhin verwenden, falls Ihr Code darauf abzielt. Allerdings beansprucht GPT-5.6 Performance-Parität (oder besser) zur gleichen Schicht, daher migrieren Sie zu 5.6 für neue Deployments.

Die ChatGPT-Schnittstelle setzt ältere Modelle weiterhin auf Rollback-Basis außer Betrieb (GPT-4o mini, GPT-4 turbo sind jetzt schreibgeschützt); API-Zugriff ist stabil. Falls Sie gegen die API entwickeln, planen Sie jährliche Reviews des Modell-Deprecation-Status, erwarten Sie aber keine Dringlichkeit.

Kostenmeßrahmen

Schritt 1: Baseline pro Schicht etablieren

Führen Sie eine Woche Traffic aus und protokollieren Sie, welche Schicht jede Anfrage handhabte. Dies gibt Ihnen Baseline-Verteilung und Kosten.

Schritt 2: Zuversichtswerte und Fallback-Raten messen

Für jede Schicht protokollieren Sie zurückgegebene Zuversicht. Berechnen Sie: Welcher % der Luna-Aufrufe haben Zuversicht > 85%? Welcher % kaskadiert zu Terra? Dies sagt Ihnen, ob Ihr Cascade ausgewogen ist.

Schritt 3: Erfolg/Misserfolg pro Schicht überprüfen

Vergleichen Sie Modellausgabe gegen Grundwahrheit für eine Woche. Welche Schicht unterperformt bei Ihren Daten? Justieren Sie Schwellenwerte oder Schichtwahl basierend auf echter Genauigkeit, nicht OpenAI-Behauptungen.

Schritt 4: Echte Kosten pro erfolgreicher Antwort berechnen

Echte Kosten = (Schicht_Kosten) / (Erfolgsrate). Falls Luna $1,20 pro 1K bei 94% Erfolg kostet, ist Kosten pro funktionierender Antwort $1,28. Dies ist die Metrik zu optimieren.

Quick Schicht-Auswahl-Checkliste


Schichtwahl ist ein Klassifizierungsproblem: Passen Sie Arbeitsbelastungs-Eigenschaften zu Schicht-Ökonomie an. Das Ideal ist Cascade-Routing — routen Sie zu Luna zuerst, messen Sie Zuversicht, eskalieren Sie bei Unsicherheit. Dies minimiert Kosten bei Qualitätsmaintenance. FinOps LLM kann eine Kostenüberprüfung bei Ihrem LLM-Traffic durchführen und Ihnen zeigen, wo Schicht-Nichtübereinstimmung Geld auf der Theke lässt. Kostenlose Überprüfung buchen.

Siehe auch: Wie viel kostet GPT-5? für die vollständige GPT-Preislandschaft und Verborgene LLM-Kosten für Infrastruktur- und Fallback-Kosten über reine Pro-Token-Gebühren hinaus.

Zurück zu Forschung