Vai al contenuto

Claude Sonnet 5.5: cosa cambia e cosa no

Aggiornato September 28, 2026 · pubblicato inizialmente September 27, 2026

Claude Sonnet 5.5 costa $2 per milione di token di input e $10 per milione di token di output sull'API di Anthropic, lo stesso prezzo di listino di Sonnet 5. Il cambiamento economico è l'efficienza: Anthropic afferma che Sonnet 5.5 può costare fino al 30% in meno per task perché usa meno token, generando al tempo stesso l'output più del 30% più velocemente. Si tratta di un massimo dichiarato dal fornitore, non di uno sconto garantito su ogni carico di lavoro.

Per una previsione di budget, tieni fisse le tariffe per token e modella separatamente la possibile riduzione di token e di passi dell'agente. Misura il tuo mix reale di task prima di applicare qualsiasi ipotesi di risparmio.

Prezzi API di Sonnet 5.5

Tipo di tokenPrezzo per milione
Input$2.00
Output$10.00
Scrittura in cache da 5 minuti$2.50
Scrittura in cache da 1 ora$4.00
Lettura dalla cache$0.20

Anthropic pubblica queste tariffe nel suo annuncio di lancio di Sonnet 5.5. Non interpretare “fino al 30% in meno per task” come una riduzione del 30% delle tariffe per token: i prezzi di input e output sono invariati rispetto a Sonnet 5. Il prezzo di $2/$10 di Sonnet 5 è inoltre ormai quello standard, dopo che Anthropic ha annullato l'aumento previsto per settembre.

Esempio: efficienza dei token contro variazioni di tariffa

Consideriamo un task che usa 100,000 token di input e 10,000 di output, senza cache. Alle tariffe pubblicate di Sonnet 5.5 fanno $0.20 di input più $0.10 di output, cioè $0.30 per task. Se lo stesso task usasse il 30% di token in meno in entrambe le categorie, il costo modellato sarebbe di $0.21. È un'illustrazione del calcolo, non una promessa che ogni task userà il 30% di token in meno.

Per un carico di 10,000 task di questo tipo al mese, la base è di $3,000. Una riduzione del 30% del volume di token farebbe risparmiare $900, portando la bolletta mensile modellata a $2,100. I risultati reali variano in base alla lunghezza dei prompt, al riuso della cache, alla lunghezza dell'output, all'impegno di ragionamento, ai retry e alle chiamate a tool.

Cosa mostrano e cosa non mostrano i benchmark di lancio

Anthropic riporta miglioramenti nelle sue valutazioni di coding e di lavoro di conoscenza, tra cui Terminal-Bench 4.0 e CursorBench. L'azienda segnala anche che Sonnet 5.5 genera l'output più del 30% più velocemente di Sonnet 5 e che in diversi confronti sui benchmark raggiunge i punteggi precedenti di Sonnet 5 a una frazione del costo per task. Questi risultati sono ipotesi utili per un piano di valutazione, ma sono misure pubblicate dal fornitore, non dati indipendenti sui costi in produzione.

Un'avvertenza pratica: un modello più veloce non abbassa automaticamente una fattura API a consumo di token. La fattura scende quando diminuisce il consumo per task completato, o quando meno task richiedono retry o escalation. Una generazione più veloce può invece migliorare il throughput o ridurre la latenza lasciando invariata la spesa in token.

Un modo sicuro per prevedere l'adozione

  1. Mantieni fisso il listino. Usa $2/$10 per milione di token di input/output come punto di partenza per Sonnet 5 e 5.5.
  2. Misura il lavoro completato. Confronta il costo per task accettato, non solo i token per richiesta. Includi retry, chiamate a tool e rilavorazione umana dove possibile.
  3. Dividi per carico di lavoro. Valuta separatamente coding, supporto, estrazione e task a contesto lungo; un unico tasso di risparmio medio può nascondere regressioni.
  4. Usa un intervallo. Fai il budget con 0% di risparmio finché i test interni non forniscono evidenze, poi aggiungi scenari misurati. Tratta il «fino al 30%» di Anthropic come un'affermazione di limite superiore, non come la tua previsione.
  5. Ricontrolla qualità e latenza. Una fattura di token più bassa non è un risparmio se cala il tasso di accettazione o servono modelli di fallback più costosi.

FAQ

Sonnet 5.5 è più economico per token?

No. Anthropic indica le stesse tariffe di Sonnet 5: $2 di input e $10 di output per milione di token. La sua affermazione sul costo per task deriva dall'uso di meno token per svolgere un lavoro comparabile.

Il risparmio del 30% è garantito?

No. Anthropic descrive riduzioni di costo fino al 30% per la maggior parte del lavoro nei materiali di lancio. Il tuo risultato dipende dal carico di lavoro, dal prompt caching, dalle impostazioni di effort e dalla qualità del completamento dei task.

Quanto costa una richiesta con cache?

Anthropic indica le letture dalla cache a $0.20 per milione di token, le scritture da 5 minuti a $2.50 e quelle da 1 ora a $4.00. Consulta la documentazione sui prezzi dell'API Claude aggiornata prima di fissare una previsione.

Dobbiamo spostare subito il traffico di produzione?

Esegui prima una valutazione rappresentativa. Testa il modello in shadow o in canary, confronta costo per risultato accettato e latenza, e mantieni una rotta di rollback per i carichi che peggiorano.

Fonti e letture correlate

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com