Costo reale per attività dei modelli di frontiera
Updated September 22, 2026 · first published September 22, 2026
I prezzi di listino dicono quanto costa un token. Non dicono quanto costa un'attività completata, perché i modelli spendono quantità di token molto diverse per fare lo stesso lavoro. Questa pagina mette fianco a fianco il costo per attività misurato e un punteggio di qualità per Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra e GPT-6 Sol a ogni livello di effort. Ogni cifra ha una fonte e nulla è stimato.
La risposta breve: GPT-6 Sol è il modo più economico per raggiungere qualsiasi punteggio fino a 47,5. Sopra 47,5, Opus 5.5 è il più economico a ogni livello. Nessuna impostazione di GPT-6 Astra sopra low, di Opus 5 o di Fable 5.1 è efficiente nei costi: ognuna è battuta per punteggio e prezzo da un'impostazione di Sol o di Opus 5.5.
Metodo
Tutti i punteggi e i costi vengono dall'Artificial Analysis Intelligence Index v4.3.2, consultato il 22 settembre 2026. L'indice esegue dieci valutazioni: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR. Artificial Analysis esegue ogni modello a ogni livello di effort tramite l'API del fornitore e registra quanto paga a prezzi di listino. Il costo per attività è questa spesa per attività, divisa tra input e output. Ogni riga usa la stessa suite, quindi le righe si confrontano direttamente.
Prima di leggere i numeri valgono due limiti. Primo, l'indice è un solo mix di attività. Il vostro mix sposterà i costi, ed è per questo che l'ultima sezione spiega come misurare i vostri. Secondo, i punteggi di versioni diverse dell'indice non si confrontano, quindi non mescolate queste cifre con numeri pubblicati in precedenza.
La scala completa: 26 impostazioni
I token di output per attività sono quelli che il modello scrive, ragionamento incluso. Artificial Analysis non pubblica la ripartizione tra input e output per le quattro impostazioni intermedie di GPT-6 Sol, quindi quelle celle riportano n/a.
| Modello | Effort | Intelligence Index | Costo per attività | Costo di input | Costo di output | Token di output per attività | Sulla frontiera |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | No |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | Sì |
| GPT-6 Sol | medium (predefinito) | 39.8 | $0.25 | n/a | n/a | 6,500 | Sì |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | Sì |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | Sì |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | Sì |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | Sì |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | No |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | No |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | No |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | No |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | No |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | No |
| Claude Opus 5 | high (predefinito) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | No |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | No |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | No |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | No |
| Claude Opus 5.5 | medium (predefinito) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | Sì |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | Sì |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | Sì |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | Sì |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | No |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | No |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | No |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | No |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | No |
Sulla frontiera significa che nessun'altra impostazione di questa tabella ottiene un punteggio più alto spendendo meno.
La frontiera dei costi
Dieci delle 26 impostazioni sono sulla frontiera. Ordinate per costo, sono le sole che vale la pena considerare in base al solo prezzo. Tutte le altre pagano di più per lo stesso punteggio o per uno inferiore.
| Impostazione | Intelligence Index | Costo per attività | Per 10.000 attività |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
La frontiera ha due zone. Da 0,13 $ a 1,06 $ è quasi solo GPT-6 Sol, con GPT-6 Astra low a 0,82 $ come unica eccezione. Da 1,34 $ in su è solo Opus 5.5. Il salto tra le due zone è piccolo: Opus 5.5 medium ottiene 3,7 punti in più di Sol max per 0,28 $ in più per attività.
Testa a testa a punteggio uguale o migliore
Ogni coppia confronta un'impostazione più economica con una più cara che ottiene un punteggio uguale o inferiore.
| Impostazione più economica | Impostazione più cara | Scarto di punteggio | Risparmio |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | +3.1 per Opus 5.5 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | +0.4 per Opus 5.5 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | pari | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | +0.9 per Opus 5.5 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | +0.2 per Opus 5.5 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | +0.6 per Opus 5 | 71% |
La riga di Opus 5 conta per i team che non hanno ancora migrato. Opus 5 funzionava di default a effort high. Opus 5.5 funziona di default a medium e, con quel valore, ottiene 3,1 punti in più per il 63% in meno per attività. Anthropic dichiara che Opus 5.5 costa il 40% in meno di Opus 5; lo scarto misurato su questo indice è più ampio di quanto dichiarato.
Dove vanno i soldi: input, non output
Per ogni modello, l'input vale tra circa la metà e i tre quarti del costo per attività. Per Opus 5.5 a medium, 0,82 $ su 1,34 $ sono input, cioè il 61%. Per GPT-6 Astra a max è il 58%, per GPT-6 Sol a max il 70% e per Fable 5.1 a max il 49%. Le attività da agente rinviano il contesto crescente a ogni passo, quindi la spesa di input cresce con il numero di passi e non solo con la lunghezza della risposta.
Per questo GPT-6 Sol senza ragionamento costa più che a low: 0,33 $ contro 0,13 $, anche se scrive solo 4.900 token di output. 0,28 $ dei 0,33 $ sono input. La causa probabile sono più passi, ognuno dei quali rinvia il contesto. Spegnere il ragionamento non rende un agente più economico se poi gli servono più turni.
Per la vostra bolletta, questo significa che la cache conta quanto la scelta del modello. Opus 5.5 e GPT-6 Sol fanno pagare 0,20 $ per milione di token di input in cache. GPT-6 Astra fa pagare 1,00 $ e Opus 5 0,50 $.
Volume di token contro prezzo di listino
GPT-6 Astra è qui il modello più parsimonioso con i token. A effort max scrive 27.200 token di output per attività, contro 119.200 di Opus 5.5 max. Ma Astra costa 10 $ e 50 $ per milione, 2,5× la tariffa di Opus 5.5. Vince il prezzo di listino: Opus 5.5 high costa 1,82 $ per attività con 53,6 punti, mentre Astra max costa 3,26 $ con 52,7.
Opus 5.5 a max è l'unico punto in cui la prolissità pesa. I suoi 119.200 token di output costano 2,38 $ prima di qualsiasi input, e l'attività completa costa 5,98 $. Compra il punteggio più alto della tabella, 57,6, ma a 4,5× il costo di medium.
Rendimenti decrescenti per livello di effort
Ogni riga mostra cosa compra un livello di effort in più, in punti di indice contro il costo aggiuntivo per attività.
| Modello | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +3.0 punti per +48% | +3.4 punti per +100% |
| GPT-6 Astra | +1.3 punti per +12% | +0.3 punti per +41% |
| Claude Opus 5 | +3.3 punti per +65% | +1.1 punti per +20% |
| Claude Opus 5.5 | +2.4 punti per +36% | +1.6 punti per +73% |
| Claude Fable 5.1 | +2.3 punti per +31% | +0.2 punti per +28% |
Per Fable 5.1 e GPT-6 Astra, l'effort max non compra quasi nulla: 0,2 e 0,3 punti per il 28% e il 41% in più. Per Opus 5.5 il passaggio a max compra ancora 1,6 punti, ma costa il 73% in più. Usate max solo nelle attività in cui avete misurato che i punti extra cambiano il risultato.
Quando GPT-6 Sol max basta
L'indice è una media, e il divario tra Sol max e Opus 5.5 medium non è uniforme. Punteggi per valutazione secondo Artificial Analysis:
| Valutazione | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
Su AutomationBench e CritPt, GPT-6 Sol eguaglia o supera Opus 5.5 a medium per 1,06 $ per attività contro 1,34 $. Su Terminal-Bench, sulle valutazioni di lavoro della conoscenza e su Humanity's Last Exam, Opus 5.5 è nettamente avanti. L'automazione dei flussi di lavoro può girare su Sol. Gli agenti da terminale e di coding e il lavoro della conoscenza con molti documenti sono dove Opus 5.5 giustifica il prezzo.
Dati del fornitore contro dati indipendenti
I dati dei fornitori e quelli indipendenti spesso divergono, perché usano harness e impostazioni diversi. Anthropic dichiara il 66,4% su Terminal-Bench 4.0 per Opus 5.5 a xhigh. Artificial Analysis misura il 59,6% allo stesso effort.
| Effort | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
Anche la classifica cambia con l'indice. Nel Vals AI Index, Fable 5.1 è primo con il 68,83%, GPT-6 Astra terzo con il 66,61% e Opus 5.5 quarto con il 66,16%. Lì il costo per attività non è pubblicato sulla stessa base, quindi non sposta la frontiera sopra. Un indice è solo un punto di vista.
Prezzi di listino e un'attività con molta cache
Digital Applied ha calcolato il prezzo di un'attività da agente con molta cache su ogni modello: 8M token di lettura cache, 400K di input non in cache, 600K di scrittura in cache e 300K di output. Il risultato segue la frontiera, con una penalità aggiuntiva per GPT-6 Astra.
| Modello | Input $/MTok | Output $/MTok | Lettura cache $/MTok | Attività con molta cache (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra fattura l'intera richiesta a 20 $ e 75 $ per milione quando l'input supera i 272K token. Opus 5.5 mantiene un solo prezzo su tutta la finestra da 1M token. Per Opus 5.5 la scrittura in cache costa 5 $ per milione per la cache da 5 minuti e 8 $ per quella da 1 ora, i batch sono fatturati al 50% e la modalità veloce raddoppia il prezzo. Per i dettagli, vedi il Modello dei costi di Claude Opus 5.5 e l'Economia della modalità veloce di Opus 5.5.
Come misurare il vostro costo per attività
- Registrate i token per attività, non per richiesta: input non in cache, input in cache, scritture in cache e output, sommati su tutti i passi dell'attività.
- Prendete un campione di qualche centinaio di attività reali e rieseguitelo su due o tre impostazioni candidate, per esempio Sol max, Opus 5.5 medium e Opus 5.5 high.
- Valutate ogni risultato con lo stesso controllo usato in produzione e contate le attività superate.
- Dividete la spesa totale per le attività superate. Il costo per attività riuscita è il numero da confrontare, perché un'impostazione economica che fallisce più spesso non è economica.
- Scegliete l'impostazione più economica che supera la vostra soglia di qualità e inviate a un'impostazione superiore solo le attività fallite.
- Ripetete il test quando cambia un prezzo o un effort predefinito.
Per come l'effort cambia la bolletta di un singolo modello, vedi I livelli di effort di Opus 5.5 sono il vero prezzo.
Avvertenze
- Tutti i costi sono a prezzi di listino dell'API sul mix di attività di Artificial Analysis. Sconti, batch e la vostra cache li modificano.
- Artificial Analysis etichetta le sue voci di Opus 5.5 e Fable 5.1 come Default Fallback. Leggete le note di metodologia prima di trattare ogni riga come la stessa configurazione API.
- I punteggi sono solo della versione v4.3.2 dell'indice. Le versioni precedenti usavano altre valutazioni e non si confrontano.
- L'attività con molta cache di Digital Applied è un carico illustrativo, non una misurazione.
- I numeri cambiano quando i fornitori cambiano prezzi o impostazioni predefinite. La data di consultazione è il 22 settembre 2026.
Fonti
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
- Modello dei costi di Claude Opus 5.5
- I livelli di effort di Opus 5.5 sono il vero prezzo
- Economia della modalità veloce di Opus 5.5
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →