Model kosztów Claude Fable 5.1
Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026
Claude Fable 5.1 (claude-fable-5-1) kosztuje $10 za milion tokenów wejściowych i $50 za milion wyjściowych. Opus 5 kosztuje $5 i $25. Jeśli patrzysz tylko na te cztery liczby, Fable wygląda na płaską premię 2×. To zły model. Stawka za wejście z cache idzie w przeciwnym kierunku, a przy produkcyjnym obciążeniu to zwykle cache zawiera większość tokenów.
Cztery stawki, które mają znaczenie
Model nie ma jednej ceny. Fable 5.1 rozlicza pięć różnych typów tokenów, a tylko dwa z nich są w nagłówku.
| Typ tokenu | Fable 5.1 | Opus 5 |
|---|---|---|
| Wejście (bez cache) | $10.00 / MTok | $5.00 / MTok |
| Wyjście | $50.00 / MTok | $25.00 / MTok |
| Zapis do cache (5-minutowy) | $12.50 / MTok | $6.25 / MTok |
| Zapis do cache (1-godzinny) | $20.00 / MTok | $10.00 / MTok |
| Odczyt z cache | $0.25 / MTok | $0.50 / MTok |
Odczyt z cache to wyjątek. Kosztuje 2.5% własnej ceny wejściowej Fable z cennika i połowę tego, co ten sam token w cache kosztuje w Opus 5. Każdy inny wiersz to 2×; ten jeden wiersz to 0.5×.
Co to robi z realnym obciążeniem
Weź agenta z promptem systemowym, schematem narzędzi i pobranym kontekstem na 100,000 tokenów, wielokrotnie używanym w sesji. Przy zimnym wywołaniu prefiks kosztuje $1.00 w Fable i $0.50 w Opus 5. Przy ciepłym wywołaniu kosztuje $0.025 w Fable i $0.05 w Opus 5. Dostawca, który był dwa razy droższy, staje się o połowę tańszy, przy tym samym prompcie, bo jedyne, co się zmieniło, to to, czy prefiks trafił w cache.
Punkt równowagi to więc współczynnik trafień w cache, a nie preferencja modelu. Poniżej mniej więcej 50% tokenów wejściowych obsłużonych z cache dominuje premia Fable za wejście i Opus 5 jest na prefiksie tańszy. Powyżej tego progu stawka cache Fable wychodzi na prowadzenie i dalej się oddala. Tokeny wyjściowe pozostają 2× w obu przypadkach, dlatego drugą dźwignią jest długość wyjścia, a nie wybór modelu.
Wyjście jest nieograniczoną stroną
Fable 5.1 przyjmuje okno kontekstu 1M tokenów i może wygenerować do 128K tokenów wyjścia w jednej odpowiedzi. Przy $50 za milion pojedyncza odpowiedź 128K to $6.40 wyjścia. Rozszerzone myślenie jest w tym modelu zawsze włączone — nie da się go wyłączyć, a stare sterowanie budget_tokens jest odrzucane z błędem 400. Zamiast tego dostajesz ustawienie effort od low do max. To teraz pokrętło kosztu i powinno znaleźć się w polityce routingu obok wyboru modelu, a nie w domyślnych ustawieniach aplikacji, do których nikt nie wraca.
Surowe rozumowanie nigdy nie jest zwracane, więc telemetria nie odtworzy kosztu myślenia z tekstu odpowiedzi. Musisz odczytywać go z bloku usage przy każdym wywołaniu i go zapisywać. Ten model też nie ma Priority Tier, więc opóźnienia nie da się kupić — planowanie mocy trzeba zrobić po swojej stronie przez współbieżność i kolejkowanie.
Co zmierzyć, zanim skierujesz ruch
Trzy pola decydują, czy Fable 5.1 jest w danym przypadku tani, czy drogi, i żadne z nich nie pojawia się w cenniku.
- Współczynnik trafień w cache według funkcji. Nie średnia na poziomie konta — czat na poziomie 90% i zadanie wsadowe na 0% znoszą się nawzajem do bezsensownych 45%.
- Wzmocnienie zapisów do cache. Zapis 1-godzinny kosztuje 2× cenę wejścia z cennika. Prefiks, który jest przepisywany częściej, niż czytany, to strata netto przy każdym TTL.
- Tokeny wyjściowe na udane zadanie. Premia 2× za wyjście uzasadnia się tylko wtedy, gdy potrzeba mniej prób. Mierz koszt na udane zadanie, a nie koszt na wywołanie.
Następnie porównaj z obecnym modelem jako mostem wariancji, rozdzielając stawkę, wolumen i miks. Model dwa razy droższy w cenniku i o połowę tańszy w cache pokaże się jako dwa duże, znoszące się ruchy, a średnia ukryje oba.
Powiązane
Powiązane
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →