LLM-API-Preisvergleich

Aktualisiert am 15. Juli 2026 · erstmals veröffentlicht am 4. Juli 2026

Verfolgung von Token-Preisen über alle großen LLM-Anbieter. Eingabe, Ausgabe, Cache-Lesen/-Schreiben, Kontextfenster und Batch-Rabatte in einer normalisierten Tabelle. Monatlich aktualisiert mit überprüfbaren Anbieterdaten.

12+Anbieter verfolgt
25+Modelle aufgelistet
6Preisspalten
Jul 2026Zuletzt aktualisiert

Methodik

Erfassung

Preisdaten erfasst von offiziellen Preisseiten der Anbieter und API-Dokumentation.

Normalisierung

Alle Preise normalisiert auf USD pro 1 Million Tokens für direkten Vergleich.

Cache-Preise

Cache-Lesen/-Schreiben-Spalten zeigen Prompt-Caching-Rabatte, wo Anbieter diese unterstützen.

Anzeigerichtlinie

Offizielle und geschätzte Werte sind klar getrennt. Schätzungen in Grau markiert.

Aktualisierungsverlauf

4 Jul 2026

LLM-API-Preisvergleich veröffentlicht

Token-Preisvergleich über 12+ große LLM-Anbieter als FinOps-LLM-Forschungsartikel veröffentlicht.

Token-Preistabelle

Anbieter Modell Eingabe $/1M Ausgabe $/1M Cache-Lesen $/1M Cache-Schreiben $/1M Kontextfenster Batch-Rabatt
OpenAI GPT-5.6-Sol $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.6-Terra $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI GPT-5.6-Luna $1.00 $6.00 $0.10 $1.25 128K 50%
OpenAI GPT-5.5 $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.4 $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI o3 $2.00 $8.00 $0.50 $2.00 200K 50%
OpenAI o4-mini $1.10 $4.40 $0.28 $1.10 200K 50%
Anthropic Claude Fable 5 $10.00 $50.00 $1.00 $12.50 200K 50%
Anthropic Claude Opus 4.8 $5.00 $25.00 $0.50 $6.25 200K 50%
Anthropic Claude Sonnet 5* $2.00 $10.00 $0.20 $2.50 200K 50%
Anthropic Claude Haiku 4.5 $1.00 $5.00 $0.10 $1.25 200K 50%
Google Gemini 3.5 Flash $1.50 $9.00 $0.15 $1.88 1M 50%
Google Gemini 3.1 Pro Preview $2.00 $12.00 $0.20 $2.50 1M 50%
Google Gemini 2.5 Pro $1.25 $5.00 $0.31 $4.50 1M 50%
Google Gemini 2.5 Flash $0.15 $0.60 $0.04 $0.15 1M 50%
xAI Grok 4.5 $2.00 $6.00 $0.50 $1.50 1M 50%
xAI Grok 4.3 $1.25 $2.50 - - 1M 50%
Meta Llama 4 Maverick (DeepInfra) $0.20 $0.80 - - 1M -
Meta Llama 4 Scout (Groq) $0.11 $0.34 - - 5M -
Meta Llama 3.3 70B (Groq) $0.59 $0.79 - - 8M -
Mistral Mistral Large 2/3 $2.00 $6.00 - - 128K -
Mistral Mistral Medium 3.5 $1.50 $7.50 - - 128K -
Mistral Mistral Small 3 $0.10 $0.30 - - 128K -
Mistral Codestral $0.30 $0.90 - - 128K -
DeepSeek DeepSeek V4 Flash $0.14 $0.28 $0.0028 - 128K -
DeepSeek DeepSeek V4 Pro $0.435 $0.87 $0.0036 - 128K -
Alibaba Qwen Qwen 3.7-Max $2.50 $7.50 - - 131K -
Moonshot Kimi Kimi K2.6 $0.95 $4.00 $0.16 - 200K -
Xiaomi MiMO
Anmelden - beide erhalten $2 ↗
MiMo-V2-Pro $0.50 $2.00 - - 128K -
Xiaomi MiMO
Anmelden - beide erhalten $2 ↗
MiMo-V2-Omni $0.40 $1.60 - - 128K -
Zhipu AI GLM-5 $1.00 $4.00 - - 128K -
Zhipu AI GLM-5-Turbo $0.30 $1.20 - - 128K -
MiniMax M2.7 $0.40 $1.60 - - 128K -
StepFun step-3.5-flash $0.30 $1.20 - - 128K -

* Claude Sonnet 5: Einführungspreise von $2/$10 pro 1M Tokens gültig bis 31. August 2026; Standardpreise $3/$15 ab 1. September 2026.

Werte, die nicht explizit von Anbietern angegeben werden, werden in Grau angezeigt.

Meta Llama-Preise spiegeln gehostete API-Preise (Fireworks, Together usw.) wider, nicht Kosten für das Selbst-Hosting. Die Ökonomie des Selbst-Hosting wird in unserem Open-Source- vs. Closed-Source-Kostenvergleich behandelt.

Kontextfenster sind die maximal unterstützten; die tatsächliche Verfügbarkeit kann je nach Stufe variieren.

Cache-Lesen/-Schreiben-Preise spiegeln anbieterspezifisches Prompt-Caching wider, wo verfügbar. "-" bedeutet, dass der Anbieter kein Caching anbietet oder der Preis nicht veröffentlicht ist.

Batch-Rabatt zeigt die ungefähren Einsparungen beim Einsatz von Batch-/Async-APIs, wo verfügbar.

Einige Links enthalten möglicherweise Referralmittelungscodes.

Preise können sich häufig ändern. Überprüfen Sie immer die neuesten Informationen auf den offiziellen Anbieterseiten.

Praktischer Leitfaden

Verwendung dieser Preisdaten zur Kostenplanung

1) Berechnen Sie zuerst Ihr Token-Volumen

Bevor Sie Preise vergleichen, schätzen Sie Ihre monatlichen Ein- und Ausgabe-Token-Volumen. Ausgabe-Tokens sind typischerweise 3-5x teurer als Eingabe, daher hat die Reduzierung der Ausgabelänge die größte Auswirkung auf die Kosten.

2) Beachten Sie Cache-Einsparungen

Wenn Ihre Arbeitslast wiederholte Systemaufforderungen oder Kontext hat (RAG, Multi-Turn-Gespräche), kann Prompt-Caching die Eingabekosten um 50-90% reduzieren. Prüfen Sie die Cache-Lesen-Spalte auf anwendbare Rabatte.

3) Verwenden Sie Batch-APIs für nicht dringende Arbeiten

Die meisten großen Anbieter bieten 50% Rabatt auf Batch-/Async-API-Aufrufe. Wenn Ihre Arbeitslast Latenz toleriert (Evaluierungen, Datenverarbeitung, Inhaltsgenerierung), werden Batch-Preise halbiert.

4) Vergleichen Sie Gesamtkosten, nicht nur Pro-Token-Preis

Ein preiswertes Modell, das 3x mehr Tokens benötigt, um die Qualität zu erreichen, kann insgesamt teurer sein. Berücksichtigen Sie die Modellqualität und aufgabenspezifische Leistung neben den Rohpreisen.


Möchten Sie dies auf Ihre eigenen LLM-Kosten angewendet? FinOps LLM führt ein kostenloses Audit Ihrer KI-Kosten durch und zeigt, wo die Einsparungen liegen. Kostenlose Auditor buchen →

Zurück zur Forschung