Vai al contenuto

Modello di costo di Claude Fable 5.1

Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026

Risposta rapida: Claude Fable 5.1 (claude-fable-5-1) costa $10 per milione di token di input e $50 per milione di token di output. Opus 5 costa $5 e $25. Se guardi solo questi quattro numeri, Fable sembra un premio...

Claude Fable 5.1 (claude-fable-5-1) costa $10 per milione di token di input e $50 per milione di token di output. Opus 5 costa $5 e $25. Se guardi solo questi quattro numeri, Fable sembra un premio fisso del 2×. È il modello sbagliato. La tariffa dell’input in cache si muove nella direzione opposta, e in un carico di lavoro di produzione la cache è di solito dove si concentra la maggior parte dei token.

Le quattro tariffe che contano

Un modello non ha un solo prezzo. Fable 5.1 fattura cinque tipi di token diversi, e solo due compaiono in prima pagina.

Tipo di tokenFable 5.1Opus 5
Input (non in cache)$10.00 / MTok$5.00 / MTok
Output$50.00 / MTok$25.00 / MTok
Scrittura in cache (5 minuti)$12.50 / MTok$6.25 / MTok
Scrittura in cache (1 ora)$20.00 / MTok$10.00 / MTok
Lettura dalla cache$0.25 / MTok$0.50 / MTok

La lettura dalla cache è l’anomalia. Vale il 2,5% del prezzo di input a listino di Fable, ed è la metà di quanto costa lo stesso token in cache su Opus 5. Ogni altra riga è 2×; quella sola è 0,5×.

Cosa succede su un carico reale

Prendi un agente con un system prompt da 100.000 token, uno schema di strumenti e contesto recuperato, riutilizzato lungo una sessione. Alla prima chiamata a freddo il prefisso costa $1.00 su Fable e $0.50 su Opus 5. Su una chiamata a caldo costa $0.025 su Fable e $0.05 su Opus 5. Il provider che costava il doppio ora costa la metà, con lo stesso prompt, perché l’unica cosa cambiata è se il prefisso ha colpito la cache.

Quindi il punto di pareggio è un tasso di cache hit, non una preferenza per il modello. Sotto circa il 50% dei token di input serviti dalla cache, il premio di input di Fable domina e Opus 5 costa meno sul prefisso. Sopra, la tariffa in cache di Fable va in vantaggio e continua ad allargarlo. I token di output restano 2× in entrambi i casi, ed è per questo che la seconda leva è la lunghezza dell’output, non la scelta del modello.

L’output è il lato senza tetto

Fable 5.1 accetta una finestra di contesto da 1M di token e può emettere fino a 128K token di output in una sola risposta. A $50 per milione, una singola risposta da 128K costa $6.40 di output. Il ragionamento esteso è sempre attivo per questo modello — non c’è modo di disattivarlo, e il vecchio controllo budget_tokens viene rifiutato con un 400. Al suo posto c’è un’impostazione effort da low a max. È ora una manopola del costo, e va nella tua policy di routing accanto alla scelta del modello, non nei default dell’applicazione che nessuno rivede più.

Il ragionamento grezzo non viene mai restituito, quindi la telemetria non può ricostruire il costo del ragionamento dal testo della risposta. Devi leggerlo dal blocco usage a ogni chiamata e salvarlo. Anche su questo modello non c’è un Priority Tier, quindi la latenza non si può comprare: la pianificazione della capacità va fatta con concorrenza e code dal tuo lato.

Cosa strumentare prima di instradare il traffico

Tre campi decidono se Fable 5.1 per te è economico o caro, e nessuno di loro compare in un listino.

Poi confronta con il tuo modello attuale tramite un bridge di varianza che separi tariffa, volume e mix. Un modello che costa il doppio a listino e la metà in cache si presenterà come due grandi movimenti opposti, e una media nasconde entrambi.

Correlati

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com