Echte kosten per taak bij frontiermodellen

Updated September 22, 2026 · first published September 22, 2026

Lijstprijzen vertellen wat een token kost. Ze vertellen niet wat een afgeronde taak kost, want modellen gebruiken voor hetzelfde werk heel verschillende aantallen tokens. Deze pagina zet gemeten kosten per taak en een kwaliteitsscore naast elkaar voor Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra en GPT-6 Sol op elk effort-niveau. Elk cijfer heeft een bron en niets is geschat.

Het korte antwoord: GPT-6 Sol is de goedkoopste weg naar elke score tot 47,5. Boven 47,5 is Opus 5.5 op elk niveau het goedkoopst. Geen enkele instelling van GPT-6 Astra boven low, van Opus 5 of van Fable 5.1 is kostenefficiënt: elk wordt op score en prijs verslagen door een instelling van Sol of Opus 5.5.

Methode

Alle scores en kosten komen uit de Artificial Analysis Intelligence Index v4.3.2, geraadpleegd op 22 september 2026. De index draait tien evaluaties: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience en AA-LCR. Artificial Analysis draait elk model op elk effort-niveau via de API van de aanbieder en legt vast wat het tegen lijstprijzen betaalt. Kosten per taak zijn die uitgaven per taak, gesplitst in input en output. Elke rij draait dezelfde suite, dus de rijen zijn direct vergelijkbaar.

Voordat u de cijfers leest, gelden twee grenzen. Ten eerste is de index één takenmix. Uw mix verschuift de kosten, en daarom legt de laatste sectie uit hoe u die zelf meet. Ten tweede zijn scores uit verschillende indexversies niet vergelijkbaar, dus meng deze cijfers niet met eerder gepubliceerde waarden.

De volledige ladder: 26 instellingen

Output-tokens per taak zijn de tokens die het model schrijft, redeneren inbegrepen. Artificial Analysis publiceert geen verdeling tussen input en output voor de vier middelste instellingen van GPT-6 Sol, dus daar staat n/a.

ModelEffortIntelligence IndexKosten per taakInputkostenOutputkostenOutput-tokens per taakOp de frontier
GPT-6 Solnone28.1$0.33$0.28$0.054,900Nee
GPT-6 Sollow33.9$0.13n/an/a3,400Ja
GPT-6 Solmedium (standaard)39.8$0.25n/an/a6,500Ja
GPT-6 Solhigh42.8$0.37n/an/a10,200Ja
GPT-6 Solxhigh44.1$0.53n/an/a16,000Ja
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Ja
GPT-6 Astralow45.8$0.82$0.60$0.224,400Ja
GPT-6 Astramedium49.6$1.54$1.06$0.489,600Nee
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800Nee
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Nee
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Nee
Claude Opus 5low39.4$1.10$0.73$0.3714,700Nee
Claude Opus 5medium44.8$2.19$1.47$0.7229,000Nee
Claude Opus 5high (standaard)48.1$3.61$2.46$1.1646,200Nee
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Nee
Claude Opus 5max50.8$5.86$4.05$1.8172,500Nee
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200Nee
Claude Opus 5.5medium (standaard)51.2$1.34$0.82$0.5125,700Ja
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600Ja
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Ja
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Ja
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600Nee
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900Nee
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100Nee
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Nee
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Nee

Op de frontier betekent dat geen andere instelling in deze tabel hoger scoort voor minder geld.

De kostenfrontier

Tien van de 26 instellingen liggen op de frontier. Gesorteerd op kosten zijn dit de enige die puur op prijs het overwegen waard zijn. Alle andere betalen meer voor dezelfde of een lagere score.

InstellingIntelligence IndexKosten per taakPer 10.000 taken
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

De frontier heeft twee zones. Van $0,13 tot $1,06 is het bijna alleen GPT-6 Sol, met GPT-6 Astra low op $0,82 als enige uitzondering. Vanaf $1,34 is het alleen Opus 5.5. De stap tussen beide is klein: Opus 5.5 medium scoort 3,7 punten meer dan Sol max voor $0,28 meer per taak.

Head-to-head bij gelijke of betere score

Elk paar vergelijkt een goedkopere instelling met een duurdere die gelijk of lager scoort.

Goedkopere instellingDuurdere instellingScoreverschilBesparing
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 voor Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 voor Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91gelijk66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 voor Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 voor Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 voor Opus 571%

De rij van Opus 5 is belangrijk voor teams die nog niet zijn gemigreerd. Opus 5 draaide standaard op high. Opus 5.5 draait standaard op medium en scoort daar 3,1 punten meer voor 63% minder per taak. Anthropic zegt dat Opus 5.5 40% goedkoper is dan Opus 5; het gemeten verschil op deze index is groter dan die claim.

Waar het geld heen gaat: input, niet output

Bij elk model is input ongeveer de helft tot driekwart van de kosten per taak. Bij Opus 5.5 op medium is $0,82 van de $1,34 input, ofwel 61%. Bij GPT-6 Astra op max is het 58%, bij GPT-6 Sol op max 70% en bij Fable 5.1 op max 49%. Agenttaken sturen hun groeiende context bij elke stap opnieuw mee, dus de inputkosten groeien met het aantal stappen en niet alleen met de lengte van het antwoord.

Daarom kost GPT-6 Sol zonder redeneren meer dan op low: $0,33 tegen $0,13, terwijl het maar 4.900 output-tokens schrijft. $0,28 van de $0,33 is input. De waarschijnlijke oorzaak is meer stappen, die elk de context opnieuw meesturen. Redeneren uitzetten maakt een agent niet goedkoper als hij daarna meer beurten nodig heeft.

Voor uw rekening betekent dit dat caching even zwaar weegt als de modelkeuze. Opus 5.5 en GPT-6 Sol rekenen $0,20 per miljoen gecachte input-tokens. GPT-6 Astra rekent $1,00 en Opus 5 $0,50.

Tokenvolume tegenover lijstprijs

GPT-6 Astra is hier het zuinigste model met tokens. Op max schrijft het 27.200 output-tokens per taak, tegen 119.200 bij Opus 5.5 max. Maar Astra rekent $10 en $50 per miljoen, 2,5× het tarief van Opus 5.5. De lijstprijs wint: Opus 5.5 high kost $1,82 per taak en scoort 53,6, terwijl Astra max $3,26 kost en 52,7 scoort.

Opus 5.5 op max is de enige plek waar breedsprakigheid pijn doet. De 119.200 output-tokens kosten $2,38 vóór enige input, en de hele taak kost $5,98. Dat levert de hoogste score in de tabel op, 57,6, maar tegen 4,5× de kosten van medium.

Afnemende meeropbrengst per effort-niveau

Elke rij toont wat één effort-niveau hoger oplevert, in indexpunten tegenover de extra kosten per taak.

Modelmedium → highxhigh → max
GPT-6 Sol+3.0 punten voor +48%+3.4 punten voor +100%
GPT-6 Astra+1.3 punten voor +12%+0.3 punten voor +41%
Claude Opus 5+3.3 punten voor +65%+1.1 punten voor +20%
Claude Opus 5.5+2.4 punten voor +36%+1.6 punten voor +73%
Claude Fable 5.1+2.3 punten voor +31%+0.2 punten voor +28%

Bij Fable 5.1 en GPT-6 Astra levert max bijna niets op: 0,2 en 0,3 punt voor 28% en 41% meer. Bij Opus 5.5 levert de stap naar max nog 1,6 punt op, maar tegen 73% meer kosten. Gebruik max alleen voor taken waarvan u hebt gemeten dat de extra punten de uitkomst veranderen.

Wanneer GPT-6 Sol max genoeg is

De index is een gemiddelde, en het verschil tussen Sol max en Opus 5.5 medium is niet overal gelijk. Scores per evaluatie volgens Artificial Analysis:

EvaluatieOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

Op AutomationBench en CritPt evenaart of verslaat GPT-6 Sol Opus 5.5 op medium, voor $1,06 per taak tegen $1,34. Op Terminal-Bench, de kenniswerk-evaluaties en Humanity's Last Exam ligt Opus 5.5 ruim voor. Workflowautomatisering kan op Sol draaien. Terminal- en codeeragents en documentzwaar kenniswerk zijn waar Opus 5.5 zijn prijs waard is.

Cijfers van de leverancier tegenover onafhankelijke cijfers

Cijfers van leveranciers en onafhankelijke cijfers verschillen vaak, omdat ze andere harnesses en instellingen gebruiken. Anthropic meldt 66,4% op Terminal-Bench 4.0 voor Opus 5.5 op xhigh. Artificial Analysis meet 59,6% op hetzelfde niveau.

EffortOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Ook de ranglijst verschilt per index. In de Vals AI Index staat Fable 5.1 eerste met 68,83%, GPT-6 Astra derde met 66,61% en Opus 5.5 vierde met 66,16%. Kosten per taak worden daar niet op dezelfde basis gepubliceerd, dus dit verschuift de frontier hierboven niet. Eén index is maar één blik.

Lijstprijzen en een cache-zware taak

Digital Applied heeft één cache-zware agenttaak op elk model doorgerekend: 8M cache-leestokens, 400K niet-gecachte input, 600K cache-schrijftokens en 300K output-tokens. Het resultaat volgt de frontier, met een extra straf voor GPT-6 Astra.

ModelInput $/MTokOutput $/MTokCache lezen $/MTokCache-zware taak (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra rekent het hele verzoek af tegen $20 en $75 per miljoen zodra de input boven 272K tokens komt. Opus 5.5 houdt één prijs over zijn hele venster van 1M tokens. Bij Opus 5.5 kosten cache-schrijfacties $5 per miljoen voor de cache van 5 minuten en $8 voor die van 1 uur, batchtaken kosten 50% en de snelle modus verdubbelt de prijs. Zie voor details het Kostenmodel voor Claude Opus 5.5 en de Economie van de snelle modus van Opus 5.5.

Zo meet u uw eigen kosten per taak

  1. Log tokens per taak, niet per verzoek: niet-gecachte input, gecachte input, cache-schrijfacties en output, opgeteld over alle stappen van de taak.
  2. Neem een steekproef van een paar honderd echte taken en speel die opnieuw af op twee of drie kandidaat-instellingen, bijvoorbeeld Sol max, Opus 5.5 medium en Opus 5.5 high.
  3. Beoordeel elk resultaat met dezelfde controle als in productie en tel de geslaagde taken.
  4. Deel de totale uitgaven door het aantal geslaagde taken. Kosten per geslaagde taak zijn het getal om te vergelijken, want een goedkope instelling die vaker faalt is niet goedkoop.
  5. Kies de goedkoopste instelling die uw kwaliteitslat haalt en stuur alleen mislukte taken door naar een hogere instelling.
  6. Herhaal de test wanneer een prijs of een standaard-effort verandert.

Hoe effort-niveaus de rekening van één model veranderen, leest u in De effort-niveaus van Opus 5.5 zijn de echte prijs.

Kanttekeningen

Bronnen

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research