GPT-5.6-Preisschichten-Anleitung: Luna, Terra, Sol
Veröffentlicht 19. Juli 2026
OpenAI veröffentlichte GPT-5.6 am 10. Juli mit drei unterschiedlichen Preisschichten: Luna bei $1/$6 pro 1M Token, Terra bei $2,50/$15 und Sol bei $5/$30. Dies ist kein einfacher Geschwindigkeit/Qualität-Kompromiss; jede Schicht ist für eine andere Klasse von Arbeitsbelastung positioniert. Die Frage ist nicht "welche ist am besten" — es ist "welche ist richtig für diese Aufgabe?" Diese Anleitung ordnet Aufgaben Schichten zu, geht durchgerechnete Kostenbeispiele durch und zeigt Ihnen, wie Sie intelligent eskalieren, wenn eine günstigere Schicht nicht zuversichtlich genug ist.
- Luna ($1/$6): Klassifizierung, einfache Extraktion, Hochvolumen-Routing
- Terra ($2,50/$15): ausgewogenes Reasoning, Agent-Schleifen, Multi-Turn-Konversationen
- Sol ($5/$30): Frontier-Reasoning, Code-Generierung, schwierige Forschung
- Cache-Lesevorgänge sparen 90%; Cache-Schreibvorgänge kosten 1,25× Eingabe — Break-Even bei 5+ Treffern in 30 Min
- Batch API addiert 50% Rabatt zusätzlich zu Preisen der Schicht für nicht-interaktive Arbeit
1. Die Drei Schichten: Geschwindigkeit, Kosten und Fähigkeit
| Schicht | Eingabe $/1M | Ausgabe $/1M | Cache-Lesevorgang $/1M | Kontext | Typische Latenz |
|---|---|---|---|---|---|
| Luna | $1.00 | $6.00 | $0.10 | 128K | 80–200 ms |
| Terra | $2.50 | $15.00 | $0.25 | 128K | 150–400 ms |
| Sol | $5.00 | $30.00 | $0.50 | 128K | 300–800 ms |
Latenz ist wichtig: Luna ist am schnellsten, weil es für Streaming, Echtzeit-Klassifizierung und Durchsatz optimiert ist. Sol ist am langsamsten, weil es mehr internes Reasoning durchführt. Für interaktive benutzergerichtete Arbeitsbelastungen ist Luna auch günstiger und schneller — aber nur wenn es für Ihre Aufgabe leistungsfähig genug ist. Dies ist die Schlüssel-Routing-Entscheidung.
2. Aufgabentyp-Routing-Tabelle
Diese Tabelle ordnet häufige LLM-Aufgaben der Schicht zu, die die Kosten pro erfolgreicher Antwort minimiert:
| Aufgabentyp | Beispiel | Empfohlene Schicht | Erfolgsrate bei Schicht | Geschätzte Kosten/1K Aufgaben |
|---|---|---|---|---|
| Klassifizierung | Spam / Nicht-Spam; Stimmung (pos/neg/neutral) | Luna | 95–98% | $1.20–$1.50 |
| Strukturierte Extraktion | Name, E-Mail, Telefon aus Text extrahieren | Luna | 92–96% | $1.80–$2.40 |
| Kategorisierung (viele Klassen) | Einer von 50+ Produktkategorien zuordnen | Luna | 88–94% | $2.40–$3.20 |
| Zusammenfassung | Artikel oder Chat-Protokoll kondensieren | Luna | 92–97% | $1.50–$2.00 |
| Agent-Schleifen (Tool-Nutzung) | Multi-Turn: suchen, reasoning, verfeinern | Terra | 85–92% | $8.00–$12.00 |
| Multi-Turn-Konversation | Kundensupport-Bots, Beratungs-Bots | Terra | 88–94% | $6.00–$10.00 |
| Code-Generierung (einfach) | SQL-Abfrage, Bash-Snippet, Regex | Terra | 80–90% | $10.00–$15.00 |
| Code-Generierung (komplex) | Vollständiger Endpoint, State Machine, DSL-Compiler | Sol | 75–88% | $25.00–$40.00 |
| Forschung + Synthese | 10+ Papers analysieren, Konsens synthetisieren | Sol | 80–90% | $30.00–$50.00 |
| Schwieriges Reasoning (neuartiges Problem) | Beweis-Verifikation, neuartige Algorithmen-Gestaltung | Sol | 70–85% | $40.00–$70.00 |
Schlüsseleinsicht: Kosten pro Aufgabe sind nicht nur API-Kosten — es ist (API-Kosten) / (Erfolgsrate). Eine Luna-Klassifizierung mit 95% Erfolgsrate kostet ~$1,26 pro erfolgreiche Antwort. Falls Sie dieselbe Aufgabe zu Sol bei 98% Erfolgsrate routen, zahlen Sie ~$5,10 pro Antwort — aber Sie haben 3% mehr Ihrer Arbeitsbelastung gelöst, was den 4× Kosten möglicherweise wert ist oder nicht.
3. Durchgerechnete Kostenbeispiele Pro Aufgabe
Beispiel 1: Spam-Klassifizierung (Luna)
Aufgabe: E-Mail als Spam klassifizieren (binär Ja/Nein).
Typisches Token-Profil: 400 Eingabe (E-Mail) + 50 Ausgabe (Klassifizierung + Zuversicht) = 450 Token.
Luna-Kosten: (400 × $1/1M) + (50 × $6/1M) = $0,00043/Anfrage.
Falls 96% beim ersten Versuch erfolgreich: $0,00043 / 0,96 = $0,00045 pro erfolgreicher Klassifizierung.
Bei 1M E-Mails/Monat: $450/Monat (plus Cache-Rabatt, falls Sie System-Prompts wiederverwenden).
Falls fälschlicherweise zu Sol geroutet: (400 × $5 + 50 × $30) / 1M = $0,0025 pro Anfrage. Bei 98% Erfolg: $0,00255/Erfolg = $2.550/Monat (5,7× mehr).
Beispiel 2: Kundensupport-Agent (Terra)
Aufgabe: Multi-Turn-Supportkonversation mit Tool-Nutzung (Ticket-Suche, Policy-Suche, Eskalationsentscheidung).
Typisches Token-Profil pro Turn: 2.000 Eingabe (Kontext + Verlauf) + 400 Ausgabe (Antwort + Tool-Aufrufe) = 2.400 Token. Durchschnittlich 3 Turns zum Lösen = 7.200 Token gesamt pro Ticket.
Terra-Kosten: (2.000 × $2,50/1M) + (400 × $15/1M) = $0,0080/Turn oder $0,0240 pro Ticket.
Falls 90% ohne Eskalation gelöst: $0,0240 / 0,90 = $0,0267 pro erfolgreichen Ticket.
Bei 10K Tickets/Monat: $267/Monat.
Falls Luna stattdessen verwendet: (2.000 × $1 + 400 × $6) / 1M = $0,0044 pro Turn = $0,0132/Ticket. Aber Lunas Agent-Loop-Erfolg fällt auf 65% (Tool-Aufrufe versagen, Reasoning ist oberflächlich). Kosten pro Erfolg: $0,0132 / 0,65 = $0,0203. Nettoeinsparung: $29/Monat, aber 25% der Tickets schlagen fehl und eskalieren, erhöhen Supportkosten $400+. Luna funktioniert hier nicht.
Beispiel 3: Code-Generierung (Terra vs. Sol)
Aufgabe: Python-Funktion aus Anforderungsstring generieren.
Typisches Token-Profil: 1.500 Eingabe (Spezifikation + Beispiele) + 600 Ausgabe (Code + Erklärung) = 2.100 Token.
Terra-Kosten: (1.500 × $2,50 + 600 × $15) / 1M = $0,0134 pro Anfrage. Bei 85% Erfolg beim ersten Durchgang (Code kompiliert + besteht grundlegende Tests): $0,0158 pro funktionierende Funktion.
Sol-Kosten: (1.500 × $5 + 600 × $30) / 1M = $0,0255 pro Anfrage. Bei 90% Erfolg beim ersten Durchgang: $0,0283 pro funktionierende Funktion.
Einsparungen mit Terra: 44% günstiger pro funktionierendes Ergebnis. Verwenden Sie Sol nur, wenn der Unterschied von 5% in Erfolgsrate und Code-Qualität die nachgelagerten Debug-Kosten messbar reduziert.
4. Cascade- & Fallback-Routing-Muster
Die meisten FinOps-Teams sollten nicht eine einzelne Schicht für alle Arbeiten verwenden. Implementieren Sie stattdessen ein Cascade-Muster: Beginnen Sie mit der günstigsten Schicht, messen Sie Zuversicht, eskalieren Sie bei niedriger Zuversicht.
| Schritt | Modell | Zuversichts-Schwellenwert | Aktion falls Schwelle nicht erfüllt |
|---|---|---|---|
| 1 | Luna | Zuversicht > 85% | Ergebnis zurückgeben |
| 2 | Terra | Zuversicht > 75% | Ergebnis zurückgeben (eskaliert) |
| 3 | Sol | Zuversicht > 60% | Ergebnis zurückgeben oder explizit fehlschlagen |
| 4 | Menschliche Überprüfung | — | An Mensch eskalieren |
Echtes Szenario: Sie führen Dokumentenklassifizierung für Rechnungen durch (Klassifizierung nach Anbieter). Luna gibt hochzuversichtliche Ergebnisse zurück (~94% Erfolg) und kostet ~$1,20 pro 1K. Für die 6% mehrdeutiger Rechnungen, bei denen Luna Zuversicht < 85% zurückgibt, eskalieren Sie zu Terra (~94% Erfolg für schwierige Fälle), kostet ~$3,75 pro 1K Eskalationen. Falls 6% von 10K Dokumenten eskalieren: 600 × $3,75 = $2,25 extra, gesamt $12 + $2,25 = $14,25/10K. Reines Terra würde ~$37,50 kosten. Cascade spart 62% während die Genauigkeit bei Grenzfällen verbessert wird.
5. Prompt-Caching-Ökonomie
GPT-5.6 änderte Caching-Kosten: Cache-Schreibvorgänge kosten jetzt 1,25× die unkachedEingaberate (nicht kostenlos), und Cache-Lesevorgänge kosten 10% der Eingabe.
| Szenario | Präfix-Größe | Schreibkosten | Lesekosten (pro Treffer) | Break-Even-Treffer | Einsparungen @ 10 Treffer/Monat |
|---|---|---|---|---|---|
| Luna gecachte Abrufkontext | 100K Token | $0.125 | $0.010 | 15 Treffer | -$0.025 (Verlust) |
| Luna gecachter System-Prompt + Dokumente | 50K Token | $0.063 | $0.005 | 8 Treffer | $0.032 |
| Terra gecachter Agent-Kontext | 80K Token | $0.250 | $0.020 | 14 Treffer | $0.030 |
| Sol gecachter Reasoning-Kontext | 100K Token | $0.625 | $0.050 | 13 Treffer | $0.025 |
Wann zu cachen: Falls Ihr Prompt ein stabiles Präfix enthält (System-Anweisungen, Dokumentation, Few-Shot-Beispiele), das mehr als 5–10 mal in einem 30-Minuten-Fenster wiederverwendet wird, spart Caching üblicherweise Geld. Batch API (50% Rabatt) konkurriert jetzt mit Caching bei Kosten — falls Sie Dokumente im Batch klassifizieren, schlägt Batch-Rabatt die Caching-Kosten.
6. Vergleich mit Claude Sonnet 5, Gemini 3.1 Pro und DeepSeek V4
| Modell | Eingabe $/1M | Ausgabe $/1M | Geschwindigkeit | Reasoning-Fähigkeit | Wann zu wählen |
|---|---|---|---|---|---|
| GPT-5.6 Luna | $1.00 | $6.00 | Schnell | Anweisungsfolge, Routing | Klassifizierung, Extraktion, Durchsatz |
| GPT-5.6 Terra | $2.50 | $15.00 | Mittel | Moderates Reasoning, Tool-Nutzung | Agenten, Multi-Turn, mittlerer Code |
| GPT-5.6 Sol | $5.00 | $30.00 | Langsam | Frontier-Reasoning, Forschung | Komplexer Code, schwieriges Reasoning, neuartige Probleme |
| Claude Sonnet 5 | $2.00–$3.00 | $10.00–$15.00 | Mittel–Schnell | Starkes Reasoning, lange Reasoning-Token | Reasoning, Codierung (konkurrenzfähig mit Sol) |
| Gemini 3.1 Pro | $2.00 | $12.00 | Mittel | Multimodal, Forschungsfähigkeit | Multimodale Aufgaben, konkurrenzfähig mit Terra |
| DeepSeek V4 Flash | $0.14 | $0.28 | Sehr Schnell | Basics-Reasoning, Cache-Fokus | Hochvolumen-Routing, Cache-intensive Arbeitslasten (7–35× günstiger) |
Kosten-Arbitrage: Für einfache Klassifizierung und Extraktion ist DeepSeek V4 Flash 7–20× günstiger als Luna. Testen Sie es gegen Ihre Daten — falls es 90%+ Genauigkeit erreicht, verwenden Sie es und sparen Sie den Unterschied. Claude Sonnet 5 ist 2× teurer als Terra, liefert aber stärkeres Reasoning pro Modell-Leistungsanspruch; verwenden Sie es, falls Ihr Terra-Benchmark unzureichende Qualität zeigt. Gemini 3.1 Pro landet zwischen Luna und Terra — nützlich, falls Sie Multimodal-Eingabe benötigen oder bereits im Vertex AI-Ökosystem sind.
7. Migration von GPT-5/5.5 & Deprecation-Status
OpenAI bietet weiterhin GPT-5.5 ($5/$30, gleich wie Sol) und GPT-5.4 ($2,50/$15, gleich wie Terra) zusammen mit GPT-5.6 an. Es gibt keinen Deprecation-Druck auf ältere Modelle — Sie können GPT-5.5 weiterhin verwenden, falls Ihr Code darauf abzielt. Allerdings beansprucht GPT-5.6 Performance-Parität (oder besser) zur gleichen Schicht, daher migrieren Sie zu 5.6 für neue Deployments.
Die ChatGPT-Schnittstelle setzt ältere Modelle weiterhin auf Rollback-Basis außer Betrieb (GPT-4o mini, GPT-4 turbo sind jetzt schreibgeschützt); API-Zugriff ist stabil. Falls Sie gegen die API entwickeln, planen Sie jährliche Reviews des Modell-Deprecation-Status, erwarten Sie aber keine Dringlichkeit.
Kostenmeßrahmen
Schritt 1: Baseline pro Schicht etablieren
Führen Sie eine Woche Traffic aus und protokollieren Sie, welche Schicht jede Anfrage handhabte. Dies gibt Ihnen Baseline-Verteilung und Kosten.
Schritt 2: Zuversichtswerte und Fallback-Raten messen
Für jede Schicht protokollieren Sie zurückgegebene Zuversicht. Berechnen Sie: Welcher % der Luna-Aufrufe haben Zuversicht > 85%? Welcher % kaskadiert zu Terra? Dies sagt Ihnen, ob Ihr Cascade ausgewogen ist.
Schritt 3: Erfolg/Misserfolg pro Schicht überprüfen
Vergleichen Sie Modellausgabe gegen Grundwahrheit für eine Woche. Welche Schicht unterperformt bei Ihren Daten? Justieren Sie Schwellenwerte oder Schichtwahl basierend auf echter Genauigkeit, nicht OpenAI-Behauptungen.
Schritt 4: Echte Kosten pro erfolgreicher Antwort berechnen
Echte Kosten = (Schicht_Kosten) / (Erfolgsrate). Falls Luna $1,20 pro 1K bei 94% Erfolg kostet, ist Kosten pro funktionierender Antwort $1,28. Dies ist die Metrik zu optimieren.
Quick Schicht-Auswahl-Checkliste
- Ist dies eine Klassifizierung-, Extraktions- oder Routing-Aufgabe? → Luna, falls Genauigkeit nicht kritisch ist.
- Beinhaltet die Aufgabe Tool-Nutzung oder Multi-Turn-Reasoning? → Terra.
- Ist dies neuartiges Reasoning, komplexer Code oder Multi-Hop-Analyse? → Sol (oder testen Sie Claude Sonnet 5 zuerst).
- Können Sie ein Cascade (Luna → Terra → Sol) implementieren? → Ja, dies ist üblicherweise optimal.
- Gibt es ein stabiles Präfix (System-Prompt, Dokumente), das 10+ mal/Monat wiederverwendet wird? → Cachen Sie es, messen Sie ROI bei Break-Even (5–15 Treffer).
- Ist dies Batch oder interaktiv? → Batch-Arbeit qualifiziert für 50% Rabatt; berechnen Sie ROI mit Batch API neu.
- Haben Sie Alternativen (Claude, DeepSeek, Gemini) testen? → Tun Sie es bei Ihren Daten, nicht Marketing-Behauptungen.
Schichtwahl ist ein Klassifizierungsproblem: Passen Sie Arbeitsbelastungs-Eigenschaften zu Schicht-Ökonomie an. Das Ideal ist Cascade-Routing — routen Sie zu Luna zuerst, messen Sie Zuversicht, eskalieren Sie bei Unsicherheit. Dies minimiert Kosten bei Qualitätsmaintenance. FinOps LLM kann eine Kostenüberprüfung bei Ihrem LLM-Traffic durchführen und Ihnen zeigen, wo Schicht-Nichtübereinstimmung Geld auf der Theke lässt. Kostenlose Überprüfung buchen.
Siehe auch: Wie viel kostet GPT-5? für die vollständige GPT-Preislandschaft und Verborgene LLM-Kosten für Infrastruktur- und Fallback-Kosten über reine Pro-Token-Gebühren hinaus.