Coût réel par tâche des modèles de pointe
Updated September 22, 2026 · first published September 22, 2026
Les prix catalogue indiquent le coût d'un token. Ils n'indiquent pas le coût d'une tâche terminée, car les modèles dépensent des quantités de tokens très différentes pour le même travail. Cette page met côte à côte le coût par tâche mesuré et un score de qualité pour Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra et GPT-6 Sol à chaque niveau d'effort. Chaque chiffre a une source, et rien n'est estimé.
La réponse courte : GPT-6 Sol est le moyen le moins cher d'atteindre n'importe quel score jusqu'à 47,5. Au-delà de 47,5, Opus 5.5 est le moins cher à chaque niveau. Aucun réglage de GPT-6 Astra au-dessus de low, d'Opus 5 ou de Fable 5.1 n'est rentable : chacun est battu en score et en prix par un réglage de Sol ou d'Opus 5.5.
Méthode
Tous les scores et coûts proviennent de l'Artificial Analysis Intelligence Index v4.3.2, consulté le 22 septembre 2026. L'indice exécute dix évaluations : AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR. Artificial Analysis exécute chaque modèle à chaque niveau d'effort via l'API du fournisseur et enregistre ce qu'il paie au prix catalogue. Le coût par tâche est cette dépense par tâche, répartie entre entrée et sortie. Toutes les lignes passent la même suite, elles se comparent donc directement.
Deux limites avant de lire les chiffres. D'abord, l'indice est un seul mélange de tâches. Votre mélange déplacera les coûts, d'où la dernière section qui explique comment mesurer les vôtres. Ensuite, les scores de versions différentes de l'indice ne se comparent pas : ne mélangez pas ces chiffres avec des résultats publiés plus tôt.
L'échelle complète : 26 réglages
Les tokens de sortie par tâche sont ceux que le modèle écrit, raisonnement compris. Artificial Analysis ne publie pas la répartition entrée/sortie pour les quatre réglages intermédiaires de GPT-6 Sol ; ces cellules indiquent donc n/a.
| Modèle | Effort | Intelligence Index | Coût par tâche | Coût d'entrée | Coût de sortie | Tokens de sortie par tâche | Sur la frontière |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | Non |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | Oui |
| GPT-6 Sol | medium (par défaut) | 39.8 | $0.25 | n/a | n/a | 6,500 | Oui |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | Oui |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | Oui |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | Oui |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | Oui |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | Non |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | Non |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | Non |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | Non |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | Non |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | Non |
| Claude Opus 5 | high (par défaut) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | Non |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | Non |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | Non |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | Non |
| Claude Opus 5.5 | medium (par défaut) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | Oui |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | Oui |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | Oui |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | Oui |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | Non |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | Non |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | Non |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | Non |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | Non |
Sur la frontière signifie qu'aucun autre réglage de ce tableau n'obtient un meilleur score pour moins cher.
La frontière des coûts
Dix des 26 réglages sont sur la frontière. Triés par coût, ce sont les seuls qui méritent d'être envisagés sur le seul critère du prix. Tous les autres paient plus pour un score égal ou inférieur.
| Réglage | Intelligence Index | Coût par tâche | Pour 10 000 tâches |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
La frontière a deux zones. De 0,13 $ à 1,06 $, c'est presque uniquement GPT-6 Sol, avec GPT-6 Astra low comme seule exception à 0,82 $. À partir de 1,34 $, c'est uniquement Opus 5.5. Le saut entre les deux est faible : Opus 5.5 medium obtient 3,7 points de plus que Sol max pour 0,28 $ de plus par tâche.
Face-à-face à score égal ou supérieur
Chaque paire compare un réglage moins cher à un réglage plus cher qui obtient un score égal ou inférieur.
| Réglage moins cher | Réglage plus cher | Écart de score | Économie |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | +3.1 pour Opus 5.5 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | +0.4 pour Opus 5.5 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | égalité | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | +0.9 pour Opus 5.5 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | +0.2 pour Opus 5.5 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | +0.6 pour Opus 5 | 71% |
La ligne Opus 5 concerne les équipes qui n'ont pas encore migré. Opus 5 tournait par défaut en effort high. Opus 5.5 tourne par défaut en medium et, à ce réglage, obtient 3,1 points de plus pour 63 % de moins par tâche. Anthropic annonce qu'Opus 5.5 est 40 % moins cher qu'Opus 5 ; l'écart mesuré sur cet indice est plus large que l'annonce.
Où part l'argent : l'entrée, pas la sortie
Pour tous les modèles, l'entrée représente entre la moitié et les trois quarts du coût par tâche. Pour Opus 5.5 medium, 0,82 $ sur 1,34 $ sont de l'entrée, soit 61 %. Pour GPT-6 Astra max c'est 58 %, pour GPT-6 Sol max 70 % et pour Fable 5.1 max 49 %. Les tâches d'agent renvoient leur contexte croissant à chaque étape : la dépense d'entrée croît avec le nombre d'étapes, pas seulement avec la longueur de la réponse.
C'est pourquoi GPT-6 Sol sans raisonnement coûte plus cher qu'en low : 0,33 $ contre 0,13 $, alors qu'il n'écrit que 4 900 tokens de sortie. 0,28 $ sur les 0,33 $ sont de l'entrée. La cause probable : plus d'étapes, chacune renvoyant le contexte. Couper le raisonnement ne rend pas un agent moins cher s'il lui faut ensuite plus de tours.
Pour votre facture, le cache compte donc autant que le choix du modèle. Opus 5.5 et GPT-6 Sol facturent 0,20 $ par million de tokens d'entrée en cache. GPT-6 Astra facture 1,00 $ et Opus 5 0,50 $.
Volume de tokens contre prix catalogue
GPT-6 Astra est le modèle le plus économe en tokens de cette liste. En effort max, il écrit 27 200 tokens de sortie par tâche, contre 119 200 pour Opus 5.5 max. Mais Astra facture 10 $ et 50 $ par million, 2,5× le tarif d'Opus 5.5. Le prix catalogue l'emporte : Opus 5.5 high coûte 1,82 $ par tâche pour un score de 53,6, alors qu'Astra max coûte 3,26 $ pour 52,7.
Opus 5.5 max est le seul cas où la verbosité coûte cher. Ses 119 200 tokens de sortie coûtent 2,38 $ avant toute entrée, et la tâche complète 5,98 $. Cela achète le meilleur score du tableau, 57,6, mais pour 4,5× le coût de medium.
Rendements décroissants par effort
Chaque ligne montre ce qu'apporte un cran d'effort supplémentaire, en points d'indice contre le surcoût par tâche.
| Modèle | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +3.0 points pour +48% | +3.4 points pour +100% |
| GPT-6 Astra | +1.3 points pour +12% | +0.3 points pour +41% |
| Claude Opus 5 | +3.3 points pour +65% | +1.1 points pour +20% |
| Claude Opus 5.5 | +2.4 points pour +36% | +1.6 points pour +73% |
| Claude Fable 5.1 | +2.3 points pour +31% | +0.2 points pour +28% |
Pour Fable 5.1 et GPT-6 Astra, l'effort max n'apporte presque rien : 0,2 et 0,3 point pour 28 % et 41 % de plus. Pour Opus 5.5, passer à max apporte encore 1,6 point, mais pour 73 % de plus. N'utilisez max que sur les tâches où vous avez mesuré que ces points changent le résultat.
Quand GPT-6 Sol max suffit
L'indice est une moyenne, et l'écart entre Sol max et Opus 5.5 medium n'est pas uniforme. Scores par évaluation selon Artificial Analysis :
| Évaluation | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
Sur AutomationBench et CritPt, GPT-6 Sol égale ou bat Opus 5.5 medium pour 1,06 $ par tâche contre 1,34 $. Sur Terminal-Bench, les évaluations de travail intellectuel et Humanity's Last Exam, Opus 5.5 mène largement. L'automatisation de workflows peut tourner sur Sol. Les agents de terminal et de code et le travail intellectuel riche en documents sont là où Opus 5.5 justifie son prix.
Chiffres du fournisseur contre chiffres indépendants
Les chiffres des fournisseurs et les chiffres indépendants diffèrent souvent, car ils utilisent d'autres harnais et d'autres réglages. Anthropic annonce 66,4 % sur Terminal-Bench 4.0 pour Opus 5.5 en xhigh. Artificial Analysis mesure 59,6 % au même effort.
| Effort | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
Le classement change aussi selon l'indice. Sur le Vals AI Index, Fable 5.1 est premier avec 68,83 %, GPT-6 Astra troisième avec 66,61 % et Opus 5.5 quatrième avec 66,16 %. Le coût par tâche n'y est pas publié sur la même base, il ne déplace donc pas la frontière ci-dessus. Un indice n'est qu'un point de vue.
Prix catalogue et une tâche riche en cache
Digital Applied a chiffré une tâche d'agent riche en cache sur chaque modèle : 8M tokens de lecture de cache, 400K d'entrée hors cache, 600K d'écriture en cache et 300K de sortie. Le résultat suit la frontière, avec une pénalité supplémentaire pour GPT-6 Astra.
| Modèle | Entrée $/MTok | Sortie $/MTok | Lecture de cache $/MTok | Tâche riche en cache (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra facture toute la requête à 20 $ et 75 $ par million dès que l'entrée dépasse 272K tokens. Opus 5.5 garde un prix unique sur toute sa fenêtre de 1M tokens. Chez Opus 5.5, l'écriture en cache coûte 5 $ par million pour le cache de 5 minutes et 8 $ pour celui d'une heure, les lots sont facturés à 50 % et le mode rapide double le prix. Pour le détail, voir Modèle de coûts de Claude Opus 5.5 et Économie du mode rapide d'Opus 5.5.
Mesurer votre propre coût par tâche
- Journalisez les tokens par tâche, pas par requête : entrée hors cache, entrée en cache, écritures en cache et sortie, additionnées sur toutes les étapes de la tâche.
- Prenez un échantillon de quelques centaines de tâches réelles et rejouez-le sur deux ou trois réglages candidats, par exemple Sol max, Opus 5.5 medium et Opus 5.5 high.
- Évaluez chaque résultat avec le même contrôle qu'en production et comptez les tâches réussies.
- Divisez la dépense totale par le nombre de tâches réussies. Le coût par tâche réussie est le chiffre à comparer : un réglage bon marché qui échoue plus souvent n'est pas bon marché.
- Choisissez le réglage le moins cher qui atteint votre seuil de qualité, puis envoyez seulement les tâches en échec vers un réglage supérieur.
- Relancez le test quand un prix ou un effort par défaut change.
Pour voir comment l'effort change la facture d'un même modèle, voir Les niveaux d'effort d'Opus 5.5 sont le vrai prix.
Réserves
- Tous les coûts sont au prix catalogue de l'API sur le mélange de tâches d'Artificial Analysis. Remises, traitement par lots et votre propre cache les modifient.
- Artificial Analysis marque ses entrées Opus 5.5 et Fable 5.1 comme Default Fallback. Lisez ses notes de méthodologie avant de traiter chaque ligne comme la même configuration d'API.
- Les scores viennent uniquement de la version v4.3.2 de l'indice. Les versions antérieures utilisaient d'autres évaluations et ne se comparent pas.
- La tâche riche en cache de Digital Applied est une charge illustrative, pas une mesure.
- Les chiffres changent quand les fournisseurs changent leurs prix ou leurs réglages par défaut. Date de consultation : 22 septembre 2026.
Sources
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
- Modèle de coûts de Claude Opus 5.5
- Les niveaux d'effort d'Opus 5.5 sont le vrai prix
- Économie du mode rapide d'Opus 5.5
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →