Claude Haiku 5.5 e la soglia di prezzo dei 100k token
Aggiornato October 8, 2026 · pubblicato inizialmente October 8, 2026
Il prezzo di listino di Claude Haiku 5.5 dipende dalla lunghezza del prompt. Anthropic ha rilasciato il modello il 7 ottobre 2026 per carichi di lavoro ad alto volume come classificazione, riassunti e attività di subagenti. La sua finestra di contesto da 1 milione di token non garantisce che tutti questi token costino la tariffa dei prompt brevi: un prompt superiore a 100.000 token usa una fascia di prezzo più alta. Questo rende il dimensionamento delle richieste una decisione di budget, soprattutto per gli agenti che accumulano documenti e risultati di strumenti.
La tariffa ha due facce
Di seguito i prezzi standard pubblicati da Anthropic per l'API di Claude, in dollari USA per milione di token, verificati l'8 ottobre. Il limite separa i prompt fino a 100.000 token da quelli oltre 100.000; non è un prezzo applicato solo ai token oltre la soglia. Consulta la documentazione prezzi aggiornata prima di usare questi valori in una previsione.
| Categoria di token | Prompt fino a 100k | Prompt oltre 100k |
|---|---|---|
| Input non in cache | $0.10 | $0.50 |
| Output | $0.50 | $2.50 |
| Scrittura in cache a 5 minuti | $0.125 | $0.625 |
| Scrittura in cache a 1 ora | $0.20 | $1.00 |
| Lettura dalla cache | $0.01 | $0.05 |
Ogni tariffa per token indicata è cinque volte più alta oltre il limite. Questo non significa che la fattura di ogni applicazione salga di cinque volte: molte chiamate possono restare brevi, e il volume di output, la cache, gli strumenti, l'elaborazione batch, i tentativi e il successo dei task incidono tutti sulla spesa totale. Il contesto in cache continua a occupare il prompt; un cache hit non trasforma una richiesta da 120k token in un prompt breve.
Come appare il limite su una singola richiesta
Consideriamo due chiamate illustrative senza cache né strumenti fatturati separatamente, che producono ciascuna 1.000 token di output. Un prompt da 99.000 token costa circa $0.0104 tra input e output alle tariffe dei prompt brevi. Un prompt da 101.000 token costa circa $0.0530 alle tariffe dei prompt lunghi. È circa cinque volte tanto per una richiesta che ha solo 2.000 token di input in più. L'esempio tiene fisso l'output per isolare il limite di prezzo; non è un risparmio misurato in produzione. I prompt reali includono anche istruzioni di sistema, cronologia della conversazione, schemi degli strumenti e risultati degli strumenti.
Ricalcola prima di migrare
Le note di migrazione di Anthropic indicano che lo stesso testo produce circa il 30% di token in più su Haiku 5.5 rispetto a Haiku 4.5, con variazioni in base al contenuto. Un prompt che con i vecchi conteggi sembrava comodamente sotto i 100k può superare il nuovo limite. Non moltiplicare tutti i vecchi conteggi per 1.3 e non trattare il risultato come previsione della fattura; ricalcola richieste rappresentative con claude-haiku-5-5.
L'endpoint di conteggio dei token di Anthropic accetta il messaggio strutturato, il system prompt e gli strumenti client supportati prima dell'invio della richiesta di generazione. Conta sul modello di destinazione, poi registra l'utilizzo effettivo dopo la risposta. Il conteggio preventivo è una stima e può differire leggermente dall'input fatturato; alcuni strumenti server e blocchi URL o file non sono supportati dal conteggio. Per questi percorsi, affidati all'utilizzo osservato delle richieste e mantieni un margine di sicurezza vicino alla soglia.
Una regola di budget dei prompt per i subagenti
- Misura la distribuzione. Registra i conteggi dei token di prompt di Haiku 5.5 per carico di lavoro, ID del modello ed esito del task. Osserva quante chiamate si concentrano vicino a 100k o le superano, invece di guardare solo la media.
- Avvisa prima del limite. Segnala nell'orchestratore degli agenti le richieste vicine alla soglia. Tratta il livello di avviso come un tuo margine operativo, non come una regola di prezzo di Anthropic.
- Riduci la causa. Elimina i frammenti di retrieval duplicati, limita la dimensione dei risultati degli strumenti o compatta la cronologia obsoleta dove i test di qualità lo consentono. Non scartare le prove di cui un agente ha bisogno solo per risparmiare token.
- Confronta la coda lunga. Per i prompt lunghi inevitabili, testa Haiku nella fascia più alta contro un'altra rotta sugli stessi task. Confronta il costo per risultato accettato, la latenza e la frequenza dei fallback, non solo i prezzi di listino.
- Riconcilia con la fattura. Valorizza input, output e letture e scritture di cache effettivi alla fascia applicabile, poi includi strumenti e tentativi. Ricontrolla le tariffe del provider o della piattaforma cloud e gli eventuali sconti contrattuali.
Haiku 5.5 può restare la scelta migliore sopra i 100k, ma dovrebbe essere una decisione di routing misurata. Il controllo importante è sapere quali richieste superano la soglia e perché.
Domande frequenti dei team
Il prezzo più alto si applica solo ai token oltre i 100k?
No. Anthropic descrive Haiku 5.5 come prezzato in base alla lunghezza del prompt: un prompt superiore a 100.000 token paga le tariffe pubblicate più alte per quella richiesta.
La cache dei prompt può mantenere una richiesta lunga nella fascia più economica?
No. I token riutilizzati possono ricevere una tariffa di lettura dalla cache, ma il contesto in cache continua a occupare la lunghezza del prompt. Conta l'intero prompt quando verifichi la soglia.
L'aumento del 30% dovuto al tokenizer è garantito?
No. Anthropic indica circa il 30% di token in più per lo stesso testo rispetto a Haiku 4.5, a seconda del contenuto. Conta i tuoi prompt sul modello di destinazione.
Correlati
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →