Echte Kosten pro Aufgabe bei Frontier-Modellen
Updated September 22, 2026 · first published September 22, 2026
Listenpreise sagen, was ein Token kostet. Sie sagen nicht, was eine fertige Aufgabe kostet, denn Modelle verbrauchen für dieselbe Arbeit sehr unterschiedlich viele Token. Diese Seite stellt gemessene Kosten pro Aufgabe und einen Qualitäts-Score für Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra und GPT-6 Sol auf jeder Effort-Stufe nebeneinander. Jede Zahl hat eine Quelle, nichts ist geschätzt.
Die kurze Antwort: GPT-6 Sol ist der günstigste Weg zu jedem Score bis 47,5. Über 47,5 ist Opus 5.5 auf jeder Stufe am günstigsten. Keine Einstellung von GPT-6 Astra oberhalb von low, von Opus 5 oder von Fable 5.1 ist kosteneffizient: Jede wird von einer Einstellung von Sol oder Opus 5.5 bei Score und Preis geschlagen.
Methode
Alle Scores und Kosten stammen aus dem Artificial Analysis Intelligence Index v4.3.2, abgerufen am 22. September 2026. Der Index umfasst zehn Evaluationen: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR. Artificial Analysis führt jedes Modell auf jeder Effort-Stufe über die API des Anbieters aus und erfasst, was es zu Listenpreisen zahlt. Die Kosten pro Aufgabe sind diese Ausgaben pro Aufgabe, aufgeteilt in Eingabe und Ausgabe. Jede Zeile durchläuft dieselbe Suite, die Zeilen sind also direkt vergleichbar.
Vor dem Lesen gelten zwei Grenzen. Erstens ist der Index nur ein Aufgabenmix. Ihr Mix verschiebt die Kosten, deshalb erklärt der letzte Abschnitt, wie Sie Ihre eigenen messen. Zweitens sind Scores aus verschiedenen Indexversionen nicht vergleichbar. Mischen Sie diese Zahlen also nicht mit älteren veröffentlichten Werten.
Die ganze Leiter: 26 Einstellungen
Ausgabe-Token pro Aufgabe sind die Token, die das Modell schreibt, Reasoning eingeschlossen. Für die vier mittleren Einstellungen von GPT-6 Sol veröffentlicht Artificial Analysis keine Aufteilung in Eingabe und Ausgabe, daher steht dort n/a.
| Modell | Effort | Intelligence Index | Kosten pro Aufgabe | Eingabekosten | Ausgabekosten | Ausgabe-Token pro Aufgabe | Auf der Frontier |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | Nein |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | Ja |
| GPT-6 Sol | medium (Standard) | 39.8 | $0.25 | n/a | n/a | 6,500 | Ja |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | Ja |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | Ja |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | Ja |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | Ja |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | Nein |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | Nein |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | Nein |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | Nein |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | Nein |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | Nein |
| Claude Opus 5 | high (Standard) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | Nein |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | Nein |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | Nein |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | Nein |
| Claude Opus 5.5 | medium (Standard) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | Ja |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | Ja |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | Ja |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | Ja |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | Nein |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | Nein |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | Nein |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | Nein |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | Nein |
Auf der Frontier heißt: Keine andere Einstellung in dieser Tabelle erzielt mehr Punkte für weniger Geld.
Die Kosten-Frontier
Zehn der 26 Einstellungen liegen auf der Frontier. Nach Kosten sortiert sind sie die einzigen, die sich rein nach Preis lohnen. Alle anderen zahlen mehr für denselben oder einen niedrigeren Score.
| Einstellung | Intelligence Index | Kosten pro Aufgabe | Pro 10.000 Aufgaben |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
Die Frontier hat zwei Bereiche. Von 0,13 $ bis 1,06 $ ist sie fast nur GPT-6 Sol, mit GPT-6 Astra low bei 0,82 $ als einziger Ausnahme. Ab 1,34 $ ist sie nur noch Opus 5.5. Der Schritt dazwischen ist klein: Opus 5.5 medium erzielt 3,7 Punkte mehr als Sol max für 0,28 $ mehr pro Aufgabe.
Direktvergleich bei gleichem oder besserem Score
Jedes Paar vergleicht eine günstigere Einstellung mit einer teureren, die gleich oder schlechter abschneidet.
| Günstigere Einstellung | Teurere Einstellung | Score-Abstand | Ersparnis |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | +3.1 für Opus 5.5 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | +0.4 für Opus 5.5 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | gleichauf | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | +0.9 für Opus 5.5 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | +0.2 für Opus 5.5 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | +0.6 für Opus 5 | 71% |
Die Opus-5-Zeile ist für Teams wichtig, die noch nicht migriert haben. Opus 5 lief standardmäßig auf high. Opus 5.5 läuft standardmäßig auf medium und erzielt dort 3,1 Punkte mehr für 63 % weniger pro Aufgabe. Anthropic gibt an, Opus 5.5 sei 40 % günstiger als Opus 5; der gemessene Abstand in diesem Index ist größer als die Angabe.
Wohin das Geld geht: Eingabe, nicht Ausgabe
Bei jedem Modell macht die Eingabe etwa die Hälfte bis drei Viertel der Kosten pro Aufgabe aus. Bei Opus 5.5 medium sind 0,82 $ von 1,34 $ Eingabe, also 61 %. Bei GPT-6 Astra max sind es 58 %, bei GPT-6 Sol max 70 % und bei Fable 5.1 max 49 %. Agentenaufgaben senden ihren wachsenden Kontext bei jedem Schritt erneut, daher wachsen die Eingabekosten mit der Zahl der Schritte, nicht nur mit der Länge der Antwort.
Deshalb kostet GPT-6 Sol ohne Reasoning mehr als auf low: 0,33 $ gegenüber 0,13 $, obwohl es nur 4.900 Ausgabe-Token schreibt. 0,28 $ der 0,33 $ sind Eingabe. Die wahrscheinliche Ursache sind mehr Schritte, die jeweils den Kontext erneut senden. Reasoning abzuschalten macht einen Agenten nicht günstiger, wenn er danach mehr Runden braucht.
Für Ihre Rechnung heißt das: Caching zählt so viel wie die Modellwahl. Opus 5.5 und GPT-6 Sol berechnen 0,20 $ pro Million gecachter Eingabe-Token. GPT-6 Astra berechnet 1,00 $ und Opus 5 0,50 $.
Token-Volumen gegen Listenpreis
GPT-6 Astra ist hier das Token-sparsamste Modell. Auf max schreibt es 27.200 Ausgabe-Token pro Aufgabe, gegenüber 119.200 bei Opus 5.5 max. Aber Astra kostet 10 $ und 50 $ pro Million, 2,5× der Preis von Opus 5.5. Der Listenpreis gewinnt: Opus 5.5 high kostet 1,82 $ pro Aufgabe bei 53,6 Punkten, Astra max 3,26 $ bei 52,7.
Opus 5.5 max ist die eine Stelle, an der Ausführlichkeit teuer wird. Seine 119.200 Ausgabe-Token kosten 2,38 $ vor jeder Eingabe, die ganze Aufgabe 5,98 $. Das bringt den höchsten Score der Tabelle, 57,6, aber zum 4,5× der Kosten von medium.
Abnehmender Ertrag pro Effort-Stufe
Jede Zeile zeigt, was eine Effort-Stufe mehr bringt: Indexpunkte gegen Mehrkosten pro Aufgabe.
| Modell | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +3.0 Punkte für +48% | +3.4 Punkte für +100% |
| GPT-6 Astra | +1.3 Punkte für +12% | +0.3 Punkte für +41% |
| Claude Opus 5 | +3.3 Punkte für +65% | +1.1 Punkte für +20% |
| Claude Opus 5.5 | +2.4 Punkte für +36% | +1.6 Punkte für +73% |
| Claude Fable 5.1 | +2.3 Punkte für +31% | +0.2 Punkte für +28% |
Bei Fable 5.1 und GPT-6 Astra bringt max fast nichts: 0,2 und 0,3 Punkte für 28 % und 41 % mehr. Bei Opus 5.5 bringt der Schritt auf max noch 1,6 Punkte, kostet aber 73 % mehr. Nutzen Sie max nur für Aufgaben, bei denen Sie gemessen haben, dass die Zusatzpunkte das Ergebnis ändern.
Wann GPT-6 Sol max reicht
Der Index ist ein Mittelwert, und der Abstand zwischen Sol max und Opus 5.5 medium ist nicht überall gleich. Scores pro Evaluation laut Artificial Analysis:
| Evaluation | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
Bei AutomationBench und CritPt erreicht oder schlägt GPT-6 Sol Opus 5.5 medium, für 1,06 $ pro Aufgabe statt 1,34 $. Bei Terminal-Bench, den Wissensarbeit-Evaluationen und Humanity's Last Exam führt Opus 5.5 deutlich. Workflow-Automatisierung kann auf Sol laufen. Terminal- und Coding-Agenten und dokumentlastige Wissensarbeit sind die Bereiche, in denen Opus 5.5 seinen Preis wert ist.
Herstellerangaben gegen unabhängige Zahlen
Hersteller- und unabhängige Zahlen weichen oft ab, weil sie andere Harnesses und Einstellungen verwenden. Anthropic meldet 66,4 % auf Terminal-Bench 4.0 für Opus 5.5 auf xhigh. Artificial Analysis misst 59,6 % bei derselben Stufe.
| Effort | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
Auch das Ranking hängt vom Index ab. Im Vals AI Index liegt Fable 5.1 mit 68,83 % vorn, GPT-6 Astra mit 66,61 % auf Platz drei und Opus 5.5 mit 66,16 % auf Platz vier. Kosten pro Aufgabe werden dort nicht auf derselben Basis veröffentlicht, daher verschiebt das die Frontier oben nicht. Ein Index ist eben nur eine Sicht.
Listenpreise und eine cache-lastige Aufgabe
Digital Applied hat eine cache-lastige Agentenaufgabe auf jedem Modell berechnet: 8M Cache-Lese-Token, 400K ungecachte Eingabe, 600K Cache-Schreib-Token und 300K Ausgabe-Token. Das Ergebnis folgt der Frontier, mit einem zusätzlichen Aufschlag für GPT-6 Astra.
| Modell | Eingabe $/MTok | Ausgabe $/MTok | Cache-Lesen $/MTok | Cache-lastige Aufgabe (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra berechnet die ganze Anfrage mit 20 $ und 75 $ pro Million, sobald die Eingabe 272K Token übersteigt. Opus 5.5 behält einen Preis über sein ganzes 1M-Token-Fenster. Bei Opus 5.5 kosten Cache-Schreibvorgänge 5 $ pro Million für den 5-Minuten-Cache und 8 $ für den 1-Stunden-Cache, Batch-Jobs werden zu 50 % berechnet und der Fast Mode verdoppelt den Preis. Details im Kostenmodell für Claude Opus 5.5 und in Wirtschaftlichkeit des Fast Mode von Opus 5.5.
So messen Sie Ihre eigenen Kosten pro Aufgabe
- Erfassen Sie Token pro Aufgabe, nicht pro Anfrage: ungecachte Eingabe, gecachte Eingabe, Cache-Schreibvorgänge und Ausgabe, summiert über alle Schritte der Aufgabe.
- Nehmen Sie eine Stichprobe von einigen hundert echten Aufgaben und spielen Sie sie auf zwei oder drei Kandidaten ab, etwa Sol max, Opus 5.5 medium und Opus 5.5 high.
- Bewerten Sie jedes Ergebnis mit derselben Prüfung wie in der Produktion und zählen Sie die bestandenen Aufgaben.
- Teilen Sie die Gesamtkosten durch die bestandenen Aufgaben. Die Kosten pro erfolgreicher Aufgabe sind die Vergleichszahl, denn eine billige Einstellung, die öfter scheitert, ist nicht billig.
- Wählen Sie die günstigste Einstellung, die Ihre Qualitätsschwelle erreicht, und leiten Sie nur gescheiterte Aufgaben an eine höhere Stufe weiter.
- Wiederholen Sie den Test, wenn sich ein Preis oder ein Standard-Effort ändert.
Wie Effort-Stufen die Rechnung eines einzelnen Modells verändern, zeigt Die Effort-Stufen von Opus 5.5 sind der echte Preis.
Einschränkungen
- Alle Kosten gelten zu API-Listenpreisen auf dem Aufgabenmix von Artificial Analysis. Rabatte, Batch-Preise und Ihr eigenes Caching verändern sie.
- Artificial Analysis kennzeichnet seine Einträge für Opus 5.5 und Fable 5.1 als Default Fallback. Prüfen Sie die Methodenhinweise, bevor Sie jede Zeile als dieselbe API-Konfiguration behandeln.
- Die Scores stammen nur aus Indexversion v4.3.2. Frühere Versionen nutzten andere Evaluationen und sind nicht vergleichbar.
- Die cache-lastige Aufgabe von Digital Applied ist eine Beispiellast, keine Messung.
- Die Zahlen ändern sich, wenn Anbieter Preise oder Standards ändern. Abrufdatum ist der 22. September 2026.
Quellen
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
- Kostenmodell für Claude Opus 5.5
- Die Effort-Stufen von Opus 5.5 sind der echte Preis
- Wirtschaftlichkeit des Fast Mode von Opus 5.5
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →