Modelo de custo do Claude Fable 5.1
Updated September 1, 2026 · first published September 1, 2026
O Claude Fable 5.1 (claude-fable-5-1) custa 10 dólares por milhão de tokens de entrada e 50 por milhão de saída; o Opus 5 custa 5 e 25. Parece um prémio fixo de 2×, mas o tarifário de cache vai no sentido oposto.
As quatro tarifas que importam
A escrita em cache custa 12,50 dólares por milhão (TTL de 5 minutos) e 20,00 (TTL de uma hora). A leitura de cache custa 0,25 por milhão: 2,5% do próprio preço de entrada e metade do que o mesmo token em cache custa no Opus 5. Todas as linhas são 2×; essa é 0,5×.
Numa carga real
Um prefixo de 100.000 tokens custa 1,00 dólar a frio no Fable e 0,50 no Opus 5. A quente, 0,025 contra 0,05. O fornecedor mais caro passa a ser o mais barato com o mesmo prompt. O ponto de equilíbrio é uma taxa de acerto de cache perto de 50%.
A saída não tem tecto
O contexto chega a um milhão de tokens e a saída a 128.000. A 50 dólares por milhão, uma única resposta de 128K custa 6,40. O raciocínio alargado está sempre activo e a configuração explícita devolve erro 400: o controlo de custo é o parâmetro effort, de baixo a máximo. Não há Priority Tier, pelo que a latência se gere com concorrência própria.
O que instrumentar antes de encaminhar tráfego
Meça a taxa de acerto de cache por funcionalidade, a amplificação das escritas em cache e os tokens de saída por tarefa bem-sucedida. Compare depois com uma ponte de variação que separe tarifa, volume e mistura; uma média esconde os dois movimentos opostos.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →