Przejdź do treści

Model kosztów Claude Fable 5.1

Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026

Krótka odpowiedź: Claude Fable 5.1 (claude-fable-5-1) kosztuje $10 za milion tokenów wejściowych i $50 za milion wyjściowych. Opus 5 kosztuje $5 i $25. Jeśli patrzysz tylko na te cztery liczby, Fable wygląda na płaską...

Claude Fable 5.1 (claude-fable-5-1) kosztuje $10 za milion tokenów wejściowych i $50 za milion wyjściowych. Opus 5 kosztuje $5 i $25. Jeśli patrzysz tylko na te cztery liczby, Fable wygląda na płaską premię 2×. To zły model. Stawka za wejście z cache idzie w przeciwnym kierunku, a przy produkcyjnym obciążeniu to zwykle cache zawiera większość tokenów.

Cztery stawki, które mają znaczenie

Model nie ma jednej ceny. Fable 5.1 rozlicza pięć różnych typów tokenów, a tylko dwa z nich są w nagłówku.

Typ tokenuFable 5.1Opus 5
Wejście (bez cache)$10.00 / MTok$5.00 / MTok
Wyjście$50.00 / MTok$25.00 / MTok
Zapis do cache (5-minutowy)$12.50 / MTok$6.25 / MTok
Zapis do cache (1-godzinny)$20.00 / MTok$10.00 / MTok
Odczyt z cache$0.25 / MTok$0.50 / MTok

Odczyt z cache to wyjątek. Kosztuje 2.5% własnej ceny wejściowej Fable z cennika i połowę tego, co ten sam token w cache kosztuje w Opus 5. Każdy inny wiersz to 2×; ten jeden wiersz to 0.5×.

Co to robi z realnym obciążeniem

Weź agenta z promptem systemowym, schematem narzędzi i pobranym kontekstem na 100,000 tokenów, wielokrotnie używanym w sesji. Przy zimnym wywołaniu prefiks kosztuje $1.00 w Fable i $0.50 w Opus 5. Przy ciepłym wywołaniu kosztuje $0.025 w Fable i $0.05 w Opus 5. Dostawca, który był dwa razy droższy, staje się o połowę tańszy, przy tym samym prompcie, bo jedyne, co się zmieniło, to to, czy prefiks trafił w cache.

Punkt równowagi to więc współczynnik trafień w cache, a nie preferencja modelu. Poniżej mniej więcej 50% tokenów wejściowych obsłużonych z cache dominuje premia Fable za wejście i Opus 5 jest na prefiksie tańszy. Powyżej tego progu stawka cache Fable wychodzi na prowadzenie i dalej się oddala. Tokeny wyjściowe pozostają 2× w obu przypadkach, dlatego drugą dźwignią jest długość wyjścia, a nie wybór modelu.

Wyjście jest nieograniczoną stroną

Fable 5.1 przyjmuje okno kontekstu 1M tokenów i może wygenerować do 128K tokenów wyjścia w jednej odpowiedzi. Przy $50 za milion pojedyncza odpowiedź 128K to $6.40 wyjścia. Rozszerzone myślenie jest w tym modelu zawsze włączone — nie da się go wyłączyć, a stare sterowanie budget_tokens jest odrzucane z błędem 400. Zamiast tego dostajesz ustawienie effort od low do max. To teraz pokrętło kosztu i powinno znaleźć się w polityce routingu obok wyboru modelu, a nie w domyślnych ustawieniach aplikacji, do których nikt nie wraca.

Surowe rozumowanie nigdy nie jest zwracane, więc telemetria nie odtworzy kosztu myślenia z tekstu odpowiedzi. Musisz odczytywać go z bloku usage przy każdym wywołaniu i go zapisywać. Ten model też nie ma Priority Tier, więc opóźnienia nie da się kupić — planowanie mocy trzeba zrobić po swojej stronie przez współbieżność i kolejkowanie.

Co zmierzyć, zanim skierujesz ruch

Trzy pola decydują, czy Fable 5.1 jest w danym przypadku tani, czy drogi, i żadne z nich nie pojawia się w cenniku.

Następnie porównaj z obecnym modelem jako mostem wariancji, rozdzielając stawkę, wolumen i miks. Model dwa razy droższy w cenniku i o połowę tańszy w cache pokaże się jako dwa duże, znoszące się ruchy, a średnia ukryje oba.

Powiązane

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com