Echte Kosten pro Aufgabe bei Frontier-Modellen

Updated September 22, 2026 · first published September 22, 2026

Listenpreise sagen, was ein Token kostet. Sie sagen nicht, was eine fertige Aufgabe kostet, denn Modelle verbrauchen für dieselbe Arbeit sehr unterschiedlich viele Token. Diese Seite stellt gemessene Kosten pro Aufgabe und einen Qualitäts-Score für Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra und GPT-6 Sol auf jeder Effort-Stufe nebeneinander. Jede Zahl hat eine Quelle, nichts ist geschätzt.

Die kurze Antwort: GPT-6 Sol ist der günstigste Weg zu jedem Score bis 47,5. Über 47,5 ist Opus 5.5 auf jeder Stufe am günstigsten. Keine Einstellung von GPT-6 Astra oberhalb von low, von Opus 5 oder von Fable 5.1 ist kosteneffizient: Jede wird von einer Einstellung von Sol oder Opus 5.5 bei Score und Preis geschlagen.

Methode

Alle Scores und Kosten stammen aus dem Artificial Analysis Intelligence Index v4.3.2, abgerufen am 22. September 2026. Der Index umfasst zehn Evaluationen: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR. Artificial Analysis führt jedes Modell auf jeder Effort-Stufe über die API des Anbieters aus und erfasst, was es zu Listenpreisen zahlt. Die Kosten pro Aufgabe sind diese Ausgaben pro Aufgabe, aufgeteilt in Eingabe und Ausgabe. Jede Zeile durchläuft dieselbe Suite, die Zeilen sind also direkt vergleichbar.

Vor dem Lesen gelten zwei Grenzen. Erstens ist der Index nur ein Aufgabenmix. Ihr Mix verschiebt die Kosten, deshalb erklärt der letzte Abschnitt, wie Sie Ihre eigenen messen. Zweitens sind Scores aus verschiedenen Indexversionen nicht vergleichbar. Mischen Sie diese Zahlen also nicht mit älteren veröffentlichten Werten.

Die ganze Leiter: 26 Einstellungen

Ausgabe-Token pro Aufgabe sind die Token, die das Modell schreibt, Reasoning eingeschlossen. Für die vier mittleren Einstellungen von GPT-6 Sol veröffentlicht Artificial Analysis keine Aufteilung in Eingabe und Ausgabe, daher steht dort n/a.

ModellEffortIntelligence IndexKosten pro AufgabeEingabekostenAusgabekostenAusgabe-Token pro AufgabeAuf der Frontier
GPT-6 Solnone28.1$0.33$0.28$0.054,900Nein
GPT-6 Sollow33.9$0.13n/an/a3,400Ja
GPT-6 Solmedium (Standard)39.8$0.25n/an/a6,500Ja
GPT-6 Solhigh42.8$0.37n/an/a10,200Ja
GPT-6 Solxhigh44.1$0.53n/an/a16,000Ja
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Ja
GPT-6 Astralow45.8$0.82$0.60$0.224,400Ja
GPT-6 Astramedium49.6$1.54$1.06$0.489,600Nein
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800Nein
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Nein
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Nein
Claude Opus 5low39.4$1.10$0.73$0.3714,700Nein
Claude Opus 5medium44.8$2.19$1.47$0.7229,000Nein
Claude Opus 5high (Standard)48.1$3.61$2.46$1.1646,200Nein
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Nein
Claude Opus 5max50.8$5.86$4.05$1.8172,500Nein
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200Nein
Claude Opus 5.5medium (Standard)51.2$1.34$0.82$0.5125,700Ja
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600Ja
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Ja
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Ja
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600Nein
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900Nein
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100Nein
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Nein
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Nein

Auf der Frontier heißt: Keine andere Einstellung in dieser Tabelle erzielt mehr Punkte für weniger Geld.

Die Kosten-Frontier

Zehn der 26 Einstellungen liegen auf der Frontier. Nach Kosten sortiert sind sie die einzigen, die sich rein nach Preis lohnen. Alle anderen zahlen mehr für denselben oder einen niedrigeren Score.

EinstellungIntelligence IndexKosten pro AufgabePro 10.000 Aufgaben
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

Die Frontier hat zwei Bereiche. Von 0,13 $ bis 1,06 $ ist sie fast nur GPT-6 Sol, mit GPT-6 Astra low bei 0,82 $ als einziger Ausnahme. Ab 1,34 $ ist sie nur noch Opus 5.5. Der Schritt dazwischen ist klein: Opus 5.5 medium erzielt 3,7 Punkte mehr als Sol max für 0,28 $ mehr pro Aufgabe.

Direktvergleich bei gleichem oder besserem Score

Jedes Paar vergleicht eine günstigere Einstellung mit einer teureren, die gleich oder schlechter abschneidet.

Günstigere EinstellungTeurere EinstellungScore-AbstandErsparnis
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 für Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 für Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91gleichauf66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 für Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 für Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 für Opus 571%

Die Opus-5-Zeile ist für Teams wichtig, die noch nicht migriert haben. Opus 5 lief standardmäßig auf high. Opus 5.5 läuft standardmäßig auf medium und erzielt dort 3,1 Punkte mehr für 63 % weniger pro Aufgabe. Anthropic gibt an, Opus 5.5 sei 40 % günstiger als Opus 5; der gemessene Abstand in diesem Index ist größer als die Angabe.

Wohin das Geld geht: Eingabe, nicht Ausgabe

Bei jedem Modell macht die Eingabe etwa die Hälfte bis drei Viertel der Kosten pro Aufgabe aus. Bei Opus 5.5 medium sind 0,82 $ von 1,34 $ Eingabe, also 61 %. Bei GPT-6 Astra max sind es 58 %, bei GPT-6 Sol max 70 % und bei Fable 5.1 max 49 %. Agentenaufgaben senden ihren wachsenden Kontext bei jedem Schritt erneut, daher wachsen die Eingabekosten mit der Zahl der Schritte, nicht nur mit der Länge der Antwort.

Deshalb kostet GPT-6 Sol ohne Reasoning mehr als auf low: 0,33 $ gegenüber 0,13 $, obwohl es nur 4.900 Ausgabe-Token schreibt. 0,28 $ der 0,33 $ sind Eingabe. Die wahrscheinliche Ursache sind mehr Schritte, die jeweils den Kontext erneut senden. Reasoning abzuschalten macht einen Agenten nicht günstiger, wenn er danach mehr Runden braucht.

Für Ihre Rechnung heißt das: Caching zählt so viel wie die Modellwahl. Opus 5.5 und GPT-6 Sol berechnen 0,20 $ pro Million gecachter Eingabe-Token. GPT-6 Astra berechnet 1,00 $ und Opus 5 0,50 $.

Token-Volumen gegen Listenpreis

GPT-6 Astra ist hier das Token-sparsamste Modell. Auf max schreibt es 27.200 Ausgabe-Token pro Aufgabe, gegenüber 119.200 bei Opus 5.5 max. Aber Astra kostet 10 $ und 50 $ pro Million, 2,5× der Preis von Opus 5.5. Der Listenpreis gewinnt: Opus 5.5 high kostet 1,82 $ pro Aufgabe bei 53,6 Punkten, Astra max 3,26 $ bei 52,7.

Opus 5.5 max ist die eine Stelle, an der Ausführlichkeit teuer wird. Seine 119.200 Ausgabe-Token kosten 2,38 $ vor jeder Eingabe, die ganze Aufgabe 5,98 $. Das bringt den höchsten Score der Tabelle, 57,6, aber zum 4,5× der Kosten von medium.

Abnehmender Ertrag pro Effort-Stufe

Jede Zeile zeigt, was eine Effort-Stufe mehr bringt: Indexpunkte gegen Mehrkosten pro Aufgabe.

Modellmedium → highxhigh → max
GPT-6 Sol+3.0 Punkte für +48%+3.4 Punkte für +100%
GPT-6 Astra+1.3 Punkte für +12%+0.3 Punkte für +41%
Claude Opus 5+3.3 Punkte für +65%+1.1 Punkte für +20%
Claude Opus 5.5+2.4 Punkte für +36%+1.6 Punkte für +73%
Claude Fable 5.1+2.3 Punkte für +31%+0.2 Punkte für +28%

Bei Fable 5.1 und GPT-6 Astra bringt max fast nichts: 0,2 und 0,3 Punkte für 28 % und 41 % mehr. Bei Opus 5.5 bringt der Schritt auf max noch 1,6 Punkte, kostet aber 73 % mehr. Nutzen Sie max nur für Aufgaben, bei denen Sie gemessen haben, dass die Zusatzpunkte das Ergebnis ändern.

Wann GPT-6 Sol max reicht

Der Index ist ein Mittelwert, und der Abstand zwischen Sol max und Opus 5.5 medium ist nicht überall gleich. Scores pro Evaluation laut Artificial Analysis:

EvaluationOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

Bei AutomationBench und CritPt erreicht oder schlägt GPT-6 Sol Opus 5.5 medium, für 1,06 $ pro Aufgabe statt 1,34 $. Bei Terminal-Bench, den Wissensarbeit-Evaluationen und Humanity's Last Exam führt Opus 5.5 deutlich. Workflow-Automatisierung kann auf Sol laufen. Terminal- und Coding-Agenten und dokumentlastige Wissensarbeit sind die Bereiche, in denen Opus 5.5 seinen Preis wert ist.

Herstellerangaben gegen unabhängige Zahlen

Hersteller- und unabhängige Zahlen weichen oft ab, weil sie andere Harnesses und Einstellungen verwenden. Anthropic meldet 66,4 % auf Terminal-Bench 4.0 für Opus 5.5 auf xhigh. Artificial Analysis misst 59,6 % bei derselben Stufe.

EffortOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Auch das Ranking hängt vom Index ab. Im Vals AI Index liegt Fable 5.1 mit 68,83 % vorn, GPT-6 Astra mit 66,61 % auf Platz drei und Opus 5.5 mit 66,16 % auf Platz vier. Kosten pro Aufgabe werden dort nicht auf derselben Basis veröffentlicht, daher verschiebt das die Frontier oben nicht. Ein Index ist eben nur eine Sicht.

Listenpreise und eine cache-lastige Aufgabe

Digital Applied hat eine cache-lastige Agentenaufgabe auf jedem Modell berechnet: 8M Cache-Lese-Token, 400K ungecachte Eingabe, 600K Cache-Schreib-Token und 300K Ausgabe-Token. Das Ergebnis folgt der Frontier, mit einem zusätzlichen Aufschlag für GPT-6 Astra.

ModellEingabe $/MTokAusgabe $/MTokCache-Lesen $/MTokCache-lastige Aufgabe (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra berechnet die ganze Anfrage mit 20 $ und 75 $ pro Million, sobald die Eingabe 272K Token übersteigt. Opus 5.5 behält einen Preis über sein ganzes 1M-Token-Fenster. Bei Opus 5.5 kosten Cache-Schreibvorgänge 5 $ pro Million für den 5-Minuten-Cache und 8 $ für den 1-Stunden-Cache, Batch-Jobs werden zu 50 % berechnet und der Fast Mode verdoppelt den Preis. Details im Kostenmodell für Claude Opus 5.5 und in Wirtschaftlichkeit des Fast Mode von Opus 5.5.

So messen Sie Ihre eigenen Kosten pro Aufgabe

  1. Erfassen Sie Token pro Aufgabe, nicht pro Anfrage: ungecachte Eingabe, gecachte Eingabe, Cache-Schreibvorgänge und Ausgabe, summiert über alle Schritte der Aufgabe.
  2. Nehmen Sie eine Stichprobe von einigen hundert echten Aufgaben und spielen Sie sie auf zwei oder drei Kandidaten ab, etwa Sol max, Opus 5.5 medium und Opus 5.5 high.
  3. Bewerten Sie jedes Ergebnis mit derselben Prüfung wie in der Produktion und zählen Sie die bestandenen Aufgaben.
  4. Teilen Sie die Gesamtkosten durch die bestandenen Aufgaben. Die Kosten pro erfolgreicher Aufgabe sind die Vergleichszahl, denn eine billige Einstellung, die öfter scheitert, ist nicht billig.
  5. Wählen Sie die günstigste Einstellung, die Ihre Qualitätsschwelle erreicht, und leiten Sie nur gescheiterte Aufgaben an eine höhere Stufe weiter.
  6. Wiederholen Sie den Test, wenn sich ein Preis oder ein Standard-Effort ändert.

Wie Effort-Stufen die Rechnung eines einzelnen Modells verändern, zeigt Die Effort-Stufen von Opus 5.5 sind der echte Preis.

Einschränkungen

Quellen

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research