LLM-API-Preisvergleich
Aktualisiert am 15. Juli 2026 · erstmals veröffentlicht am 4. Juli 2026
Verfolgung von Token-Preisen über alle großen LLM-Anbieter. Eingabe, Ausgabe, Cache-Lesen/-Schreiben, Kontextfenster und Batch-Rabatte in einer normalisierten Tabelle. Monatlich aktualisiert mit überprüfbaren Anbieterdaten.
- Alle Preise in USD pro 1 Million Tokens
- Geschätzte Werte in Grau angezeigt
- Cache-Preise spiegeln Prompt-Caching wider, wo verfügbar
Methodik
Erfassung
Preisdaten erfasst von offiziellen Preisseiten der Anbieter und API-Dokumentation.
Normalisierung
Alle Preise normalisiert auf USD pro 1 Million Tokens für direkten Vergleich.
Cache-Preise
Cache-Lesen/-Schreiben-Spalten zeigen Prompt-Caching-Rabatte, wo Anbieter diese unterstützen.
Anzeigerichtlinie
Offizielle und geschätzte Werte sind klar getrennt. Schätzungen in Grau markiert.
Aktualisierungsverlauf
LLM-API-Preisvergleich veröffentlicht
Token-Preisvergleich über 12+ große LLM-Anbieter als FinOps-LLM-Forschungsartikel veröffentlicht.
Token-Preistabelle
| Anbieter ↕ | Modell ↕ | Eingabe $/1M ↕ | Ausgabe $/1M ↕ | Cache-Lesen $/1M ↕ | Cache-Schreiben $/1M ↕ | Kontextfenster ↕ | Batch-Rabatt |
|---|---|---|---|---|---|---|---|
| OpenAI | GPT-5.6-Sol | $5.00 | $30.00 | $0.50 | $6.25 | 128K | 50% |
| OpenAI | GPT-5.6-Terra | $2.50 | $15.00 | $0.25 | $3.13 | 128K | 50% |
| OpenAI | GPT-5.6-Luna | $1.00 | $6.00 | $0.10 | $1.25 | 128K | 50% |
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $0.50 | $6.25 | 128K | 50% |
| OpenAI | GPT-5.4 | $2.50 | $15.00 | $0.25 | $3.13 | 128K | 50% |
| OpenAI | o3 | $2.00 | $8.00 | $0.50 | $2.00 | 200K | 50% |
| OpenAI | o4-mini | $1.10 | $4.40 | $0.28 | $1.10 | 200K | 50% |
| Anthropic | Claude Fable 5 | $10.00 | $50.00 | $1.00 | $12.50 | 200K | 50% |
| Anthropic | Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | $6.25 | 200K | 50% |
| Anthropic | Claude Sonnet 5* | $2.00 | $10.00 | $0.20 | $2.50 | 200K | 50% |
| Anthropic | Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | $1.25 | 200K | 50% |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | $1.88 | 1M | 50% | |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | $0.20 | $2.50 | 1M | 50% | |
| Gemini 2.5 Pro | $1.25 | $5.00 | $0.31 | $4.50 | 1M | 50% | |
| Gemini 2.5 Flash | $0.15 | $0.60 | $0.04 | $0.15 | 1M | 50% | |
| xAI | Grok 4.5 | $2.00 | $6.00 | $0.50 | $1.50 | 1M | 50% |
| xAI | Grok 4.3 | $1.25 | $2.50 | - | - | 1M | 50% |
| Meta | Llama 4 Maverick (DeepInfra) | $0.20 | $0.80 | - | - | 1M | - |
| Meta | Llama 4 Scout (Groq) | $0.11 | $0.34 | - | - | 5M | - |
| Meta | Llama 3.3 70B (Groq) | $0.59 | $0.79 | - | - | 8M | - |
| Mistral | Mistral Large 2/3 | $2.00 | $6.00 | - | - | 128K | - |
| Mistral | Mistral Medium 3.5 | $1.50 | $7.50 | - | - | 128K | - |
| Mistral | Mistral Small 3 | $0.10 | $0.30 | - | - | 128K | - |
| Mistral | Codestral | $0.30 | $0.90 | - | - | 128K | - |
| DeepSeek | DeepSeek V4 Flash | $0.14 | $0.28 | $0.0028 | - | 128K | - |
| DeepSeek | DeepSeek V4 Pro | $0.435 | $0.87 | $0.0036 | - | 128K | - |
| Alibaba Qwen | Qwen 3.7-Max | $2.50 | $7.50 | - | - | 131K | - |
| Moonshot Kimi | Kimi K2.6 | $0.95 | $4.00 | $0.16 | - | 200K | - |
| Xiaomi MiMO Anmelden - beide erhalten $2 ↗ |
MiMo-V2-Pro | $0.50 | $2.00 | - | - | 128K | - |
| Xiaomi MiMO Anmelden - beide erhalten $2 ↗ |
MiMo-V2-Omni | $0.40 | $1.60 | - | - | 128K | - |
| Zhipu AI | GLM-5 | $1.00 | $4.00 | - | - | 128K | - |
| Zhipu AI | GLM-5-Turbo | $0.30 | $1.20 | - | - | 128K | - |
| MiniMax | M2.7 | $0.40 | $1.60 | - | - | 128K | - |
| StepFun | step-3.5-flash | $0.30 | $1.20 | - | - | 128K | - |
* Claude Sonnet 5: Einführungspreise von $2/$10 pro 1M Tokens gültig bis 31. August 2026; Standardpreise $3/$15 ab 1. September 2026.
Werte, die nicht explizit von Anbietern angegeben werden, werden in Grau angezeigt.
Meta Llama-Preise spiegeln gehostete API-Preise (Fireworks, Together usw.) wider, nicht Kosten für das Selbst-Hosting. Die Ökonomie des Selbst-Hosting wird in unserem Open-Source- vs. Closed-Source-Kostenvergleich behandelt.
Kontextfenster sind die maximal unterstützten; die tatsächliche Verfügbarkeit kann je nach Stufe variieren.
Cache-Lesen/-Schreiben-Preise spiegeln anbieterspezifisches Prompt-Caching wider, wo verfügbar. "-" bedeutet, dass der Anbieter kein Caching anbietet oder der Preis nicht veröffentlicht ist.
Batch-Rabatt zeigt die ungefähren Einsparungen beim Einsatz von Batch-/Async-APIs, wo verfügbar.
Einige Links enthalten möglicherweise Referralmittelungscodes.
Preise können sich häufig ändern. Überprüfen Sie immer die neuesten Informationen auf den offiziellen Anbieterseiten.
Praktischer Leitfaden
Verwendung dieser Preisdaten zur Kostenplanung
1) Berechnen Sie zuerst Ihr Token-Volumen
Bevor Sie Preise vergleichen, schätzen Sie Ihre monatlichen Ein- und Ausgabe-Token-Volumen. Ausgabe-Tokens sind typischerweise 3-5x teurer als Eingabe, daher hat die Reduzierung der Ausgabelänge die größte Auswirkung auf die Kosten.
2) Beachten Sie Cache-Einsparungen
Wenn Ihre Arbeitslast wiederholte Systemaufforderungen oder Kontext hat (RAG, Multi-Turn-Gespräche), kann Prompt-Caching die Eingabekosten um 50-90% reduzieren. Prüfen Sie die Cache-Lesen-Spalte auf anwendbare Rabatte.
3) Verwenden Sie Batch-APIs für nicht dringende Arbeiten
Die meisten großen Anbieter bieten 50% Rabatt auf Batch-/Async-API-Aufrufe. Wenn Ihre Arbeitslast Latenz toleriert (Evaluierungen, Datenverarbeitung, Inhaltsgenerierung), werden Batch-Preise halbiert.
4) Vergleichen Sie Gesamtkosten, nicht nur Pro-Token-Preis
Ein preiswertes Modell, das 3x mehr Tokens benötigt, um die Qualität zu erreichen, kann insgesamt teurer sein. Berücksichtigen Sie die Modellqualität und aufgabenspezifische Leistung neben den Rohpreisen.
Möchten Sie dies auf Ihre eigenen LLM-Kosten angewendet? FinOps LLM führt ein kostenloses Audit Ihrer KI-Kosten durch und zeigt, wo die Einsparungen liegen. Kostenlose Auditor buchen →