Ga naar inhoud

Kostenmodel Claude Fable 5.1

Bijgewerkt September 1, 2026 · eerst gepubliceerd September 1, 2026

Kort antwoord: Claude Fable 5.1 (claude-fable-5-1) kost $10 per miljoen input-tokens en $50 per miljoen output-tokens. Opus 5 kost $5 en $25. Als je alleen die vier getallen leest, lijkt Fable een vaste premie van...

Claude Fable 5.1 (claude-fable-5-1) kost $10 per miljoen input-tokens en $50 per miljoen output-tokens. Opus 5 kost $5 en $25. Als je alleen die vier getallen leest, lijkt Fable een vaste premie van 2×. Dat is het verkeerde model. Het tarief voor gecachete input beweegt de andere kant op, en bij een productieworkload zit de cache meestal op het grootste deel van de tokens.

De vier tarieven die ertoe doen

Een model heeft niet één prijs. Fable 5.1 rekent vijf verschillende tokensoorten, en daarvan staan er maar twee in de kop.

TokensoortFable 5.1Opus 5
Input (zonder cache)$10.00 / MTok$5.00 / MTok
Output$50.00 / MTok$25.00 / MTok
Cache-schrijven (5 minuten)$12.50 / MTok$6.25 / MTok
Cache-schrijven (1 uur)$20.00 / MTok$10.00 / MTok
Cache-lezen$0.25 / MTok$0.50 / MTok

Het cache-lezen is de uitzondering. Het is 2.5% van de eigen listprijs van Fable voor input, en het is de helft van wat hetzelfde gecachete token op Opus 5 kost. Elke andere rij is 2×; deze ene rij is 0.5×.

Wat dat doet bij een echte workload

Neem een agent met een systeemprompt van 100,000 tokens, een toolschema en opgehaalde context, die over een sessie wordt hergebruikt. Bij een koude aanroep kost het prefix $1.00 op Fable en $0.50 op Opus 5. Bij een warme aanroep kost het $0.025 op Fable en $0.05 op Opus 5. De aanbieder die twee keer zo duur was, is nu de helft van de prijs, bij dezelfde prompt, omdat alleen de vraag of het prefix een cachetreffer was, is veranderd.

Het break-evenpunt is dus een cachetreffer-ratio, geen modelvoorkeur. Onder ongeveer 50% van de input-tokens uit de cache domineert Fables inputpremie en is Opus 5 goedkoper op het prefix. Daarboven loopt het gecachete tarief van Fable voor en blijft dat doen. Output-tokens blijven hoe dan ook 2×, en daarom is de tweede hefboom de lengte van de output, niet de modelkeuze.

Output is de kant zonder plafond

Fable 5.1 accepteert een contextvenster van 1M tokens en kan in één antwoord tot 128K output-tokens produceren. Tegen $50 per miljoen is één antwoord van 128K $6.40 aan output. Uitgebreid redeneren staat bij dit model altijd aan. Je kunt het niet uitzetten, en de oude instelling budget_tokens wordt afgewezen met een 400. Je krijgt in plaats daarvan een instelling effort van laag tot maximaal. Dat is nu een kostenknop, en hoort in je routeringsbeleid naast de modelkeuze, niet in applicatiestandaarden die niemand nog nakijkt.

Ruwe redeneerstappen worden nooit teruggegeven, dus je telemetrie kan de kosten van het denken niet uit de antwoordtekst afleiden. Je moet ze bij elke aanroep uit het usage-blok lezen en opslaan. Er is op dit model ook geen Priority Tier, dus latentie kun je niet inkopen. Capaciteitsplanning moet je zelf doen met concurrency en wachtrijen.

Wat je moet instrumenteren voordat je verkeer routeert

Drie velden bepalen of Fable 5.1 voor jou goedkoop of duur is, en geen van de drie staat op een prijslijst.

Draai de vergelijking daarna als variantiebrug tegen je huidige model, en splits tarief, volume en mix. Een model dat de dubbele listprijs en de helft van de cacheprijs heeft, verschijnt als twee grote tegengestelde bewegingen, en een gemiddelde verbergt beide.

Gerelateerd

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com