Modello di costo di Claude Fable 5.1
Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026
Claude Fable 5.1 (claude-fable-5-1) costa $10 per milione di token di input e $50 per milione di token di output. Opus 5 costa $5 e $25. Se guardi solo questi quattro numeri, Fable sembra un premio fisso del 2×. È il modello sbagliato. La tariffa dell’input in cache si muove nella direzione opposta, e in un carico di lavoro di produzione la cache è di solito dove si concentra la maggior parte dei token.
Le quattro tariffe che contano
Un modello non ha un solo prezzo. Fable 5.1 fattura cinque tipi di token diversi, e solo due compaiono in prima pagina.
| Tipo di token | Fable 5.1 | Opus 5 |
|---|---|---|
| Input (non in cache) | $10.00 / MTok | $5.00 / MTok |
| Output | $50.00 / MTok | $25.00 / MTok |
| Scrittura in cache (5 minuti) | $12.50 / MTok | $6.25 / MTok |
| Scrittura in cache (1 ora) | $20.00 / MTok | $10.00 / MTok |
| Lettura dalla cache | $0.25 / MTok | $0.50 / MTok |
La lettura dalla cache è l’anomalia. Vale il 2,5% del prezzo di input a listino di Fable, ed è la metà di quanto costa lo stesso token in cache su Opus 5. Ogni altra riga è 2×; quella sola è 0,5×.
Cosa succede su un carico reale
Prendi un agente con un system prompt da 100.000 token, uno schema di strumenti e contesto recuperato, riutilizzato lungo una sessione. Alla prima chiamata a freddo il prefisso costa $1.00 su Fable e $0.50 su Opus 5. Su una chiamata a caldo costa $0.025 su Fable e $0.05 su Opus 5. Il provider che costava il doppio ora costa la metà, con lo stesso prompt, perché l’unica cosa cambiata è se il prefisso ha colpito la cache.
Quindi il punto di pareggio è un tasso di cache hit, non una preferenza per il modello. Sotto circa il 50% dei token di input serviti dalla cache, il premio di input di Fable domina e Opus 5 costa meno sul prefisso. Sopra, la tariffa in cache di Fable va in vantaggio e continua ad allargarlo. I token di output restano 2× in entrambi i casi, ed è per questo che la seconda leva è la lunghezza dell’output, non la scelta del modello.
L’output è il lato senza tetto
Fable 5.1 accetta una finestra di contesto da 1M di token e può emettere fino a 128K token di output in una sola risposta. A $50 per milione, una singola risposta da 128K costa $6.40 di output. Il ragionamento esteso è sempre attivo per questo modello — non c’è modo di disattivarlo, e il vecchio controllo budget_tokens viene rifiutato con un 400. Al suo posto c’è un’impostazione effort da low a max. È ora una manopola del costo, e va nella tua policy di routing accanto alla scelta del modello, non nei default dell’applicazione che nessuno rivede più.
Il ragionamento grezzo non viene mai restituito, quindi la telemetria non può ricostruire il costo del ragionamento dal testo della risposta. Devi leggerlo dal blocco usage a ogni chiamata e salvarlo. Anche su questo modello non c’è un Priority Tier, quindi la latenza non si può comprare: la pianificazione della capacità va fatta con concorrenza e code dal tuo lato.
Cosa strumentare prima di instradare il traffico
Tre campi decidono se Fable 5.1 per te è economico o caro, e nessuno di loro compare in un listino.
- Tasso di cache hit per funzionalità. Non una media a livello di account: una superficie chat al 90% e un job batch allo 0% si annullano a vicenda in un 45% privo di significato.
- Amplificazione delle scritture in cache. Una scrittura da 1 ora costa 2× l’input a listino. Un prefisso riscritto più spesso di quanto venga letto è una perdita netta a qualsiasi TTL.
- Token di output per task completato con successo. Il premio del 2× sull’output è giustificato solo se servono meno tentativi. Misura il costo per task completato con successo, non il costo per chiamata.
Poi confronta con il tuo modello attuale tramite un bridge di varianza che separi tariffa, volume e mix. Un modello che costa il doppio a listino e la metà in cache si presenterà come due grandi movimenti opposti, e una media nasconde entrambi.
Correlati
Correlati
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →