Coût réel par tâche des modèles de pointe

Updated September 22, 2026 · first published September 22, 2026

Les prix catalogue indiquent le coût d'un token. Ils n'indiquent pas le coût d'une tâche terminée, car les modèles dépensent des quantités de tokens très différentes pour le même travail. Cette page met côte à côte le coût par tâche mesuré et un score de qualité pour Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra et GPT-6 Sol à chaque niveau d'effort. Chaque chiffre a une source, et rien n'est estimé.

La réponse courte : GPT-6 Sol est le moyen le moins cher d'atteindre n'importe quel score jusqu'à 47,5. Au-delà de 47,5, Opus 5.5 est le moins cher à chaque niveau. Aucun réglage de GPT-6 Astra au-dessus de low, d'Opus 5 ou de Fable 5.1 n'est rentable : chacun est battu en score et en prix par un réglage de Sol ou d'Opus 5.5.

Méthode

Tous les scores et coûts proviennent de l'Artificial Analysis Intelligence Index v4.3.2, consulté le 22 septembre 2026. L'indice exécute dix évaluations : AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR. Artificial Analysis exécute chaque modèle à chaque niveau d'effort via l'API du fournisseur et enregistre ce qu'il paie au prix catalogue. Le coût par tâche est cette dépense par tâche, répartie entre entrée et sortie. Toutes les lignes passent la même suite, elles se comparent donc directement.

Deux limites avant de lire les chiffres. D'abord, l'indice est un seul mélange de tâches. Votre mélange déplacera les coûts, d'où la dernière section qui explique comment mesurer les vôtres. Ensuite, les scores de versions différentes de l'indice ne se comparent pas : ne mélangez pas ces chiffres avec des résultats publiés plus tôt.

L'échelle complète : 26 réglages

Les tokens de sortie par tâche sont ceux que le modèle écrit, raisonnement compris. Artificial Analysis ne publie pas la répartition entrée/sortie pour les quatre réglages intermédiaires de GPT-6 Sol ; ces cellules indiquent donc n/a.

ModèleEffortIntelligence IndexCoût par tâcheCoût d'entréeCoût de sortieTokens de sortie par tâcheSur la frontière
GPT-6 Solnone28.1$0.33$0.28$0.054,900Non
GPT-6 Sollow33.9$0.13n/an/a3,400Oui
GPT-6 Solmedium (par défaut)39.8$0.25n/an/a6,500Oui
GPT-6 Solhigh42.8$0.37n/an/a10,200Oui
GPT-6 Solxhigh44.1$0.53n/an/a16,000Oui
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Oui
GPT-6 Astralow45.8$0.82$0.60$0.224,400Oui
GPT-6 Astramedium49.6$1.54$1.06$0.489,600Non
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800Non
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Non
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Non
Claude Opus 5low39.4$1.10$0.73$0.3714,700Non
Claude Opus 5medium44.8$2.19$1.47$0.7229,000Non
Claude Opus 5high (par défaut)48.1$3.61$2.46$1.1646,200Non
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Non
Claude Opus 5max50.8$5.86$4.05$1.8172,500Non
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200Non
Claude Opus 5.5medium (par défaut)51.2$1.34$0.82$0.5125,700Oui
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600Oui
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Oui
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Oui
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600Non
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900Non
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100Non
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Non
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Non

Sur la frontière signifie qu'aucun autre réglage de ce tableau n'obtient un meilleur score pour moins cher.

La frontière des coûts

Dix des 26 réglages sont sur la frontière. Triés par coût, ce sont les seuls qui méritent d'être envisagés sur le seul critère du prix. Tous les autres paient plus pour un score égal ou inférieur.

RéglageIntelligence IndexCoût par tâchePour 10 000 tâches
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

La frontière a deux zones. De 0,13 $ à 1,06 $, c'est presque uniquement GPT-6 Sol, avec GPT-6 Astra low comme seule exception à 0,82 $. À partir de 1,34 $, c'est uniquement Opus 5.5. Le saut entre les deux est faible : Opus 5.5 medium obtient 3,7 points de plus que Sol max pour 0,28 $ de plus par tâche.

Face-à-face à score égal ou supérieur

Chaque paire compare un réglage moins cher à un réglage plus cher qui obtient un score égal ou inférieur.

Réglage moins cherRéglage plus cherÉcart de scoreÉconomie
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 pour Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 pour Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91égalité66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 pour Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 pour Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 pour Opus 571%

La ligne Opus 5 concerne les équipes qui n'ont pas encore migré. Opus 5 tournait par défaut en effort high. Opus 5.5 tourne par défaut en medium et, à ce réglage, obtient 3,1 points de plus pour 63 % de moins par tâche. Anthropic annonce qu'Opus 5.5 est 40 % moins cher qu'Opus 5 ; l'écart mesuré sur cet indice est plus large que l'annonce.

Où part l'argent : l'entrée, pas la sortie

Pour tous les modèles, l'entrée représente entre la moitié et les trois quarts du coût par tâche. Pour Opus 5.5 medium, 0,82 $ sur 1,34 $ sont de l'entrée, soit 61 %. Pour GPT-6 Astra max c'est 58 %, pour GPT-6 Sol max 70 % et pour Fable 5.1 max 49 %. Les tâches d'agent renvoient leur contexte croissant à chaque étape : la dépense d'entrée croît avec le nombre d'étapes, pas seulement avec la longueur de la réponse.

C'est pourquoi GPT-6 Sol sans raisonnement coûte plus cher qu'en low : 0,33 $ contre 0,13 $, alors qu'il n'écrit que 4 900 tokens de sortie. 0,28 $ sur les 0,33 $ sont de l'entrée. La cause probable : plus d'étapes, chacune renvoyant le contexte. Couper le raisonnement ne rend pas un agent moins cher s'il lui faut ensuite plus de tours.

Pour votre facture, le cache compte donc autant que le choix du modèle. Opus 5.5 et GPT-6 Sol facturent 0,20 $ par million de tokens d'entrée en cache. GPT-6 Astra facture 1,00 $ et Opus 5 0,50 $.

Volume de tokens contre prix catalogue

GPT-6 Astra est le modèle le plus économe en tokens de cette liste. En effort max, il écrit 27 200 tokens de sortie par tâche, contre 119 200 pour Opus 5.5 max. Mais Astra facture 10 $ et 50 $ par million, 2,5× le tarif d'Opus 5.5. Le prix catalogue l'emporte : Opus 5.5 high coûte 1,82 $ par tâche pour un score de 53,6, alors qu'Astra max coûte 3,26 $ pour 52,7.

Opus 5.5 max est le seul cas où la verbosité coûte cher. Ses 119 200 tokens de sortie coûtent 2,38 $ avant toute entrée, et la tâche complète 5,98 $. Cela achète le meilleur score du tableau, 57,6, mais pour 4,5× le coût de medium.

Rendements décroissants par effort

Chaque ligne montre ce qu'apporte un cran d'effort supplémentaire, en points d'indice contre le surcoût par tâche.

Modèlemedium → highxhigh → max
GPT-6 Sol+3.0 points pour +48%+3.4 points pour +100%
GPT-6 Astra+1.3 points pour +12%+0.3 points pour +41%
Claude Opus 5+3.3 points pour +65%+1.1 points pour +20%
Claude Opus 5.5+2.4 points pour +36%+1.6 points pour +73%
Claude Fable 5.1+2.3 points pour +31%+0.2 points pour +28%

Pour Fable 5.1 et GPT-6 Astra, l'effort max n'apporte presque rien : 0,2 et 0,3 point pour 28 % et 41 % de plus. Pour Opus 5.5, passer à max apporte encore 1,6 point, mais pour 73 % de plus. N'utilisez max que sur les tâches où vous avez mesuré que ces points changent le résultat.

Quand GPT-6 Sol max suffit

L'indice est une moyenne, et l'écart entre Sol max et Opus 5.5 medium n'est pas uniforme. Scores par évaluation selon Artificial Analysis :

ÉvaluationOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

Sur AutomationBench et CritPt, GPT-6 Sol égale ou bat Opus 5.5 medium pour 1,06 $ par tâche contre 1,34 $. Sur Terminal-Bench, les évaluations de travail intellectuel et Humanity's Last Exam, Opus 5.5 mène largement. L'automatisation de workflows peut tourner sur Sol. Les agents de terminal et de code et le travail intellectuel riche en documents sont là où Opus 5.5 justifie son prix.

Chiffres du fournisseur contre chiffres indépendants

Les chiffres des fournisseurs et les chiffres indépendants diffèrent souvent, car ils utilisent d'autres harnais et d'autres réglages. Anthropic annonce 66,4 % sur Terminal-Bench 4.0 pour Opus 5.5 en xhigh. Artificial Analysis mesure 59,6 % au même effort.

EffortOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Le classement change aussi selon l'indice. Sur le Vals AI Index, Fable 5.1 est premier avec 68,83 %, GPT-6 Astra troisième avec 66,61 % et Opus 5.5 quatrième avec 66,16 %. Le coût par tâche n'y est pas publié sur la même base, il ne déplace donc pas la frontière ci-dessus. Un indice n'est qu'un point de vue.

Prix catalogue et une tâche riche en cache

Digital Applied a chiffré une tâche d'agent riche en cache sur chaque modèle : 8M tokens de lecture de cache, 400K d'entrée hors cache, 600K d'écriture en cache et 300K de sortie. Le résultat suit la frontière, avec une pénalité supplémentaire pour GPT-6 Astra.

ModèleEntrée $/MTokSortie $/MTokLecture de cache $/MTokTâche riche en cache (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra facture toute la requête à 20 $ et 75 $ par million dès que l'entrée dépasse 272K tokens. Opus 5.5 garde un prix unique sur toute sa fenêtre de 1M tokens. Chez Opus 5.5, l'écriture en cache coûte 5 $ par million pour le cache de 5 minutes et 8 $ pour celui d'une heure, les lots sont facturés à 50 % et le mode rapide double le prix. Pour le détail, voir Modèle de coûts de Claude Opus 5.5 et Économie du mode rapide d'Opus 5.5.

Mesurer votre propre coût par tâche

  1. Journalisez les tokens par tâche, pas par requête : entrée hors cache, entrée en cache, écritures en cache et sortie, additionnées sur toutes les étapes de la tâche.
  2. Prenez un échantillon de quelques centaines de tâches réelles et rejouez-le sur deux ou trois réglages candidats, par exemple Sol max, Opus 5.5 medium et Opus 5.5 high.
  3. Évaluez chaque résultat avec le même contrôle qu'en production et comptez les tâches réussies.
  4. Divisez la dépense totale par le nombre de tâches réussies. Le coût par tâche réussie est le chiffre à comparer : un réglage bon marché qui échoue plus souvent n'est pas bon marché.
  5. Choisissez le réglage le moins cher qui atteint votre seuil de qualité, puis envoyez seulement les tâches en échec vers un réglage supérieur.
  6. Relancez le test quand un prix ou un effort par défaut change.

Pour voir comment l'effort change la facture d'un même modèle, voir Les niveaux d'effort d'Opus 5.5 sont le vrai prix.

Réserves

Sources

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research