Costo reale per attività dei modelli di frontiera

Updated September 22, 2026 · first published September 22, 2026

I prezzi di listino dicono quanto costa un token. Non dicono quanto costa un'attività completata, perché i modelli spendono quantità di token molto diverse per fare lo stesso lavoro. Questa pagina mette fianco a fianco il costo per attività misurato e un punteggio di qualità per Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra e GPT-6 Sol a ogni livello di effort. Ogni cifra ha una fonte e nulla è stimato.

La risposta breve: GPT-6 Sol è il modo più economico per raggiungere qualsiasi punteggio fino a 47,5. Sopra 47,5, Opus 5.5 è il più economico a ogni livello. Nessuna impostazione di GPT-6 Astra sopra low, di Opus 5 o di Fable 5.1 è efficiente nei costi: ognuna è battuta per punteggio e prezzo da un'impostazione di Sol o di Opus 5.5.

Metodo

Tutti i punteggi e i costi vengono dall'Artificial Analysis Intelligence Index v4.3.2, consultato il 22 settembre 2026. L'indice esegue dieci valutazioni: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR. Artificial Analysis esegue ogni modello a ogni livello di effort tramite l'API del fornitore e registra quanto paga a prezzi di listino. Il costo per attività è questa spesa per attività, divisa tra input e output. Ogni riga usa la stessa suite, quindi le righe si confrontano direttamente.

Prima di leggere i numeri valgono due limiti. Primo, l'indice è un solo mix di attività. Il vostro mix sposterà i costi, ed è per questo che l'ultima sezione spiega come misurare i vostri. Secondo, i punteggi di versioni diverse dell'indice non si confrontano, quindi non mescolate queste cifre con numeri pubblicati in precedenza.

La scala completa: 26 impostazioni

I token di output per attività sono quelli che il modello scrive, ragionamento incluso. Artificial Analysis non pubblica la ripartizione tra input e output per le quattro impostazioni intermedie di GPT-6 Sol, quindi quelle celle riportano n/a.

ModelloEffortIntelligence IndexCosto per attivitàCosto di inputCosto di outputToken di output per attivitàSulla frontiera
GPT-6 Solnone28.1$0.33$0.28$0.054,900No
GPT-6 Sollow33.9$0.13n/an/a3,400
GPT-6 Solmedium (predefinito)39.8$0.25n/an/a6,500
GPT-6 Solhigh42.8$0.37n/an/a10,200
GPT-6 Solxhigh44.1$0.53n/an/a16,000
GPT-6 Solmax47.5$1.06$0.74$0.3131,200
GPT-6 Astralow45.8$0.82$0.60$0.224,400
GPT-6 Astramedium49.6$1.54$1.06$0.489,600No
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800No
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900No
GPT-6 Astramax52.7$3.26$1.90$1.3627,200No
Claude Opus 5low39.4$1.10$0.73$0.3714,700No
Claude Opus 5medium44.8$2.19$1.47$0.7229,000No
Claude Opus 5high (predefinito)48.1$3.61$2.46$1.1646,200No
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700No
Claude Opus 5max50.8$5.86$4.05$1.8172,500No
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200No
Claude Opus 5.5medium (predefinito)51.2$1.34$0.82$0.5125,700
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600No
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900No
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100No
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500No
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100No

Sulla frontiera significa che nessun'altra impostazione di questa tabella ottiene un punteggio più alto spendendo meno.

La frontiera dei costi

Dieci delle 26 impostazioni sono sulla frontiera. Ordinate per costo, sono le sole che vale la pena considerare in base al solo prezzo. Tutte le altre pagano di più per lo stesso punteggio o per uno inferiore.

ImpostazioneIntelligence IndexCosto per attivitàPer 10.000 attività
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

La frontiera ha due zone. Da 0,13 $ a 1,06 $ è quasi solo GPT-6 Sol, con GPT-6 Astra low a 0,82 $ come unica eccezione. Da 1,34 $ in su è solo Opus 5.5. Il salto tra le due zone è piccolo: Opus 5.5 medium ottiene 3,7 punti in più di Sol max per 0,28 $ in più per attività.

Testa a testa a punteggio uguale o migliore

Ogni coppia confronta un'impostazione più economica con una più cara che ottiene un punteggio uguale o inferiore.

Impostazione più economicaImpostazione più caraScarto di punteggioRisparmio
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 per Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 per Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91pari66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 per Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 per Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 per Opus 571%

La riga di Opus 5 conta per i team che non hanno ancora migrato. Opus 5 funzionava di default a effort high. Opus 5.5 funziona di default a medium e, con quel valore, ottiene 3,1 punti in più per il 63% in meno per attività. Anthropic dichiara che Opus 5.5 costa il 40% in meno di Opus 5; lo scarto misurato su questo indice è più ampio di quanto dichiarato.

Dove vanno i soldi: input, non output

Per ogni modello, l'input vale tra circa la metà e i tre quarti del costo per attività. Per Opus 5.5 a medium, 0,82 $ su 1,34 $ sono input, cioè il 61%. Per GPT-6 Astra a max è il 58%, per GPT-6 Sol a max il 70% e per Fable 5.1 a max il 49%. Le attività da agente rinviano il contesto crescente a ogni passo, quindi la spesa di input cresce con il numero di passi e non solo con la lunghezza della risposta.

Per questo GPT-6 Sol senza ragionamento costa più che a low: 0,33 $ contro 0,13 $, anche se scrive solo 4.900 token di output. 0,28 $ dei 0,33 $ sono input. La causa probabile sono più passi, ognuno dei quali rinvia il contesto. Spegnere il ragionamento non rende un agente più economico se poi gli servono più turni.

Per la vostra bolletta, questo significa che la cache conta quanto la scelta del modello. Opus 5.5 e GPT-6 Sol fanno pagare 0,20 $ per milione di token di input in cache. GPT-6 Astra fa pagare 1,00 $ e Opus 5 0,50 $.

Volume di token contro prezzo di listino

GPT-6 Astra è qui il modello più parsimonioso con i token. A effort max scrive 27.200 token di output per attività, contro 119.200 di Opus 5.5 max. Ma Astra costa 10 $ e 50 $ per milione, 2,5× la tariffa di Opus 5.5. Vince il prezzo di listino: Opus 5.5 high costa 1,82 $ per attività con 53,6 punti, mentre Astra max costa 3,26 $ con 52,7.

Opus 5.5 a max è l'unico punto in cui la prolissità pesa. I suoi 119.200 token di output costano 2,38 $ prima di qualsiasi input, e l'attività completa costa 5,98 $. Compra il punteggio più alto della tabella, 57,6, ma a 4,5× il costo di medium.

Rendimenti decrescenti per livello di effort

Ogni riga mostra cosa compra un livello di effort in più, in punti di indice contro il costo aggiuntivo per attività.

Modellomedium → highxhigh → max
GPT-6 Sol+3.0 punti per +48%+3.4 punti per +100%
GPT-6 Astra+1.3 punti per +12%+0.3 punti per +41%
Claude Opus 5+3.3 punti per +65%+1.1 punti per +20%
Claude Opus 5.5+2.4 punti per +36%+1.6 punti per +73%
Claude Fable 5.1+2.3 punti per +31%+0.2 punti per +28%

Per Fable 5.1 e GPT-6 Astra, l'effort max non compra quasi nulla: 0,2 e 0,3 punti per il 28% e il 41% in più. Per Opus 5.5 il passaggio a max compra ancora 1,6 punti, ma costa il 73% in più. Usate max solo nelle attività in cui avete misurato che i punti extra cambiano il risultato.

Quando GPT-6 Sol max basta

L'indice è una media, e il divario tra Sol max e Opus 5.5 medium non è uniforme. Punteggi per valutazione secondo Artificial Analysis:

ValutazioneOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

Su AutomationBench e CritPt, GPT-6 Sol eguaglia o supera Opus 5.5 a medium per 1,06 $ per attività contro 1,34 $. Su Terminal-Bench, sulle valutazioni di lavoro della conoscenza e su Humanity's Last Exam, Opus 5.5 è nettamente avanti. L'automazione dei flussi di lavoro può girare su Sol. Gli agenti da terminale e di coding e il lavoro della conoscenza con molti documenti sono dove Opus 5.5 giustifica il prezzo.

Dati del fornitore contro dati indipendenti

I dati dei fornitori e quelli indipendenti spesso divergono, perché usano harness e impostazioni diversi. Anthropic dichiara il 66,4% su Terminal-Bench 4.0 per Opus 5.5 a xhigh. Artificial Analysis misura il 59,6% allo stesso effort.

EffortOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Anche la classifica cambia con l'indice. Nel Vals AI Index, Fable 5.1 è primo con il 68,83%, GPT-6 Astra terzo con il 66,61% e Opus 5.5 quarto con il 66,16%. Lì il costo per attività non è pubblicato sulla stessa base, quindi non sposta la frontiera sopra. Un indice è solo un punto di vista.

Prezzi di listino e un'attività con molta cache

Digital Applied ha calcolato il prezzo di un'attività da agente con molta cache su ogni modello: 8M token di lettura cache, 400K di input non in cache, 600K di scrittura in cache e 300K di output. Il risultato segue la frontiera, con una penalità aggiuntiva per GPT-6 Astra.

ModelloInput $/MTokOutput $/MTokLettura cache $/MTokAttività con molta cache (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra fattura l'intera richiesta a 20 $ e 75 $ per milione quando l'input supera i 272K token. Opus 5.5 mantiene un solo prezzo su tutta la finestra da 1M token. Per Opus 5.5 la scrittura in cache costa 5 $ per milione per la cache da 5 minuti e 8 $ per quella da 1 ora, i batch sono fatturati al 50% e la modalità veloce raddoppia il prezzo. Per i dettagli, vedi il Modello dei costi di Claude Opus 5.5 e l'Economia della modalità veloce di Opus 5.5.

Come misurare il vostro costo per attività

  1. Registrate i token per attività, non per richiesta: input non in cache, input in cache, scritture in cache e output, sommati su tutti i passi dell'attività.
  2. Prendete un campione di qualche centinaio di attività reali e rieseguitelo su due o tre impostazioni candidate, per esempio Sol max, Opus 5.5 medium e Opus 5.5 high.
  3. Valutate ogni risultato con lo stesso controllo usato in produzione e contate le attività superate.
  4. Dividete la spesa totale per le attività superate. Il costo per attività riuscita è il numero da confrontare, perché un'impostazione economica che fallisce più spesso non è economica.
  5. Scegliete l'impostazione più economica che supera la vostra soglia di qualità e inviate a un'impostazione superiore solo le attività fallite.
  6. Ripetete il test quando cambia un prezzo o un effort predefinito.

Per come l'effort cambia la bolletta di un singolo modello, vedi I livelli di effort di Opus 5.5 sono il vero prezzo.

Avvertenze

Fonti

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research