Wie viel kostet GPT-5?
Aktualisiert am 15. Juli 2026 · ursprünglich veröffentlicht am 4. Juli 2026
GPT-5 ist OpenAIs Flaggschiff-Reasoning-Modell, das 2026 veröffentlicht wurde. Es bietet erheblich bessere Leistungen bei komplexen Reasoning-, Coding- und Multimodal-Aufgaben als GPT-4o – allerdings zu einem Premium-Preis. Dieser Leitfaden schlüsselt jede Kostendimension auf: API-Preise, ChatGPT-Abonnementebenen, Vergleich mit GPT-4o und wo günstigere Alternativen wie MiMO die bessere Wahl sein können.
GPT-5 API-Preise
OpenAI berechnet GPT-5 pro Million Tokens, mit separaten Sätzen für Eingabe, Ausgabe und gecachte Eingabe. Cached Reads sind erheblich günstiger, weil das Modell ein zuvor berechnetes Präfix wiederverwendet.
| Ebene | Eingabe $/1M | Ausgabe $/1M | Cache-Lesen $/1M | Kontextfenster |
|---|---|---|---|---|
| GPT-5.6-Sol (max) | $5.00 | $30.00 | $0.50 | 128K Tokens |
| GPT-5.6-Terra (mittel) | $2.50 | $15.00 | $0.25 | 128K Tokens |
| GPT-5.6-Luna (kostenbewusst) | $1.00 | $6.00 | $0.10 | 128K Tokens |
| GPT-5.5 (Flaggschiff) | $5.00 | $30.00 | $0.50 | 128K Tokens |
| GPT-5.4 (Mittelsegment) | $2.50 | $15.00 | $0.25 | 128K Tokens |
OpenAIs neue Generation von Juli 2026 (GPT-5.6) führt drei unterschiedliche Ebenen ein: Sol für Frontier-Reasoning, Terra für ausgewogene Leistung und Luna für kostenbewusste Anwendungsfälle. Zum Vergleich: ältere Modelle GPT-5.5 und 5.4 bleiben verfügbar. GPT-5.6 und 5.5 zu $5/$30 sind erheblich leistungsfähiger als GPT-4o ($2.50/$10), aber die effektiven Kosten hängen von der Reasoning-Tiefe und der Cache-Effizienz ab.
Kosten für ChatGPT-Abonnements
Wenn Sie GPT-5 über die ChatGPT-Schnittstelle statt über die API nutzen, ist die Preisgestaltung abonnementbasiert:
| Plan | Monatlicher Preis | GPT-5-Zugriff | Wichtige Limits |
|---|---|---|---|
| Free | $0 | Nur GPT-5 mini | Begrenzte Nachrichten/Tag |
| Plus | $20/Monat | GPT-5 mit Limits | ~80 GPT-5-Nachrichten/3 Std |
| Pro | $200/Monat | Unbegrenztes GPT-5 | Keine Rate Limits, Voice, Deep Research |
| Team | $25/Benutzer/Monat | GPT-5 mit höheren Limits | Admin-Tools, SSO, erhöhte Limits |
| Enterprise | Individuell | Unbegrenztes GPT-5 | SLA, dedizierter Support, Datenverwaltung |
Der Pro-Plan für $200/Monat ist nur rentabel, wenn Sie ein intensiver täglicher Nutzer sind. Für die meisten Entwickler und Teams ist die API mit sorgfältiger Token-Verwaltung günstiger als ein Pro-Abonnement.
GPT-5 vs GPT-4o: Wann macht das Upgrade Sinn?
Der Preisunterschied ist real, daher stellt sich die Frage, ob der Qualitätsvorteil von GPT-5 sich in Kosteneinsparungen an anderer Stelle auszahlt:
- Verwenden Sie GPT-5, wenn: die Aufgabe Multi-Step-Reasoning, komplexe Code-Generierung, Analyse langer Dokumente oder agentengesteuerte Workflows erfordert, bei denen ein einzelner qualitativ hochwertiger Durchgang mehrere Wiederholungszyklen spart.
- Verwenden Sie GPT-4o, wenn: die Aufgabe unkompliziert ist – Klassifizierung, Extraktion, Zusammenfassung kurzer Texte, einfaches Chat oder Batch-Verarbeitung mit hohem Volumen, wobei der Durchsatz wichtiger ist als Intelligenz pro Anfrage.
- Verwenden Sie GPT-5 mini oder nano, wenn: Sie GPT-5-ähnliche Befehlsausführung zu niedrigerem Preis benötigen und eine leicht reduzierte Reasoning-Tiefe akzeptieren können.
Eine praktische Regel: Wenn Ihre GPT-4o-Prompts Chain-of-Thought-Anweisungen oder Multi-Turn-Korrekturschleifen enthalten, kann GPT-5 tatsächlich günstiger sein, weil es dieses Reasoning nativ in einem einzelnen Aufruf durchführt.
So reduzieren Sie GPT-5-Kosten
Mehrere Strategien können Ihre GPT-5-Rechnung um 30–70% senken, ohne die Ausgabequalität zu beeinträchtigen:
- Nutzen Sie Prompt Caching. GPT-5s Cache-Read-Rate ($2.50/1M) ist 75% günstiger als die vollständige Eingaberate. Strukturieren Sie Ihre Prompts mit einem stabilen Präfix (Systemanweisungen, Kontext) und variablem Suffix (Benutzerabfrage), um Cache-Hits zu maximieren.
- Verwenden Sie GPT-5 mini/nano zum Routing. Führen Sie zunächst ein leichtes Modell aus, um die Absicht zu klassifizieren, und eskalieren Sie zu vollständigem GPT-5 nur für komplexe Abfragen. Dies ist das Model-Routing-Muster.
- Batch-API für nicht-interaktive Arbeiten. OpenAIs Batch API bietet 50% Rabatte auf asynchrone Workloads – ideal für Evaluierung, Anreicherung und Report-Generierung.
- Kontextfenster richtig dimensionieren. Senden Sie nicht 100K Tokens Kontext, wenn 5K ausreichen. Jeder unnötige Input-Token kostet auf GPT-5 4× mehr als auf GPT-4o.
- Erwägen Sie Alternativen. Für viele Coding- und Reasoning-Aufgaben bieten Modelle wie MiMO, DeepSeek R1 oder Claude Sonnet vergleichbare Qualität zu einem Bruchteil der Kosten. Nutzen Sie Provider-Arbitrage zum Benchmarking.
Versteckte Kosten jenseits des Nominalpreises
Die Pro-Token-Rate ist nur ein Teil des Gesamtbildes. Berücksichtigen Sie diese zusätzlichen Faktoren:
- Reasoning Tokens. GPT-5 nutzt interne Reasoning-Tokens für komplexe Aufgaben. Diese werden mit der Ausgaberate ($30/1M) berechnet und können Ihr effektives Ausgabevolumen bei schwierigen Problemen um das 2–5-fache vervielfachen.
- Wiederholungskosten. Wenn Ihre Prompts mehrdeutig oder Ihr Parsing fehleranfällig sind, verbrauchen gescheiterte Versuche immer noch Tokens. Robustes Prompt Engineering zahlt sich selbst aus.
- Evaluierungsausgaben. Tests und Benchmarking während der Entwicklung können leicht die Produktionsausgaben übersteigen, wenn sie nicht separat verfolgt werden. Siehe Eval-Kostenverteilung.
Fazit
GPT-5 ist teuer, aber nicht gleichmäßig. Bei $10/$30 pro Million Tokens kostet ein typischer API-Aufruf mit 1.000 Input-Tokens und 500 Output-Tokens etwa $0,025. Bei Hochvolumen-Anwendungen addiert sich die Rechnung schnell – aber intelligentes Caching, Routing und Batching können die Kosten um die Hälfte oder mehr reduzieren. Verfolgen Sie jede Anfrage, ordnen Sie Ausgaben Funktionen zu und benchmarken Sie regelmäßig Alternativen.
Verwandte Inhalte
- Wie berechnen LLM-Provider? - die Preismodelle hinter den Zahlen.
- Model Routing - die richtige Anfrage an das richtige Modell senden.
- Provider-Arbitrage – das günstigste Modell finden, das Ihre Qualitätsanforderungen erfüllt.
- Prompt Caching erklärt - wie Sie echte Cache-Hits erzielen.
Möchten Sie dies auf Ihre eigenen LLM-Ausgaben anwenden? FinOps LLM führt ein kostenloses Audit Ihrer AI-Kosten durch und zeigt, wo die Einsparungen liegen. Kostenloses Audit buchen →