Przejdź do treści

Claude Haiku 5.5 i próg cenowy 100k tokenów

Zaktualizowano October 8, 2026 · pierwsza publikacja October 8, 2026

Krótka odpowiedź: Cena katalogowa Claude Haiku 5.5 zależy od długości promptu. Anthropic udostępniło model 7 października 2026 do pracy o dużej skali, takiej jak klasyfikacja, podsumowania i zadania subagentów. Jego...

Cena katalogowa Claude Haiku 5.5 zależy od długości promptu. Anthropic udostępniło model 7 października 2026 do pracy o dużej skali, takiej jak klasyfikacja, podsumowania i zadania subagentów. Jego okno kontekstowe o pojemności 1 miliona tokenów nie oznacza, że wszystkie te tokeny kosztują stawkę dla krótkich promptów: prompt powyżej 100000 tokenów korzysta z wyższej taryfy. Dlatego rozmiar żądania staje się decyzją budżetową, szczególnie dla agentów, które gromadzą dokumenty i wyniki narzędzi.

Cennik ma dwie strony

Poniżej podano opublikowane przez Anthropic standardowe ceny Claude API w dolarach amerykańskich za milion tokenów, sprawdzone 8 października. Granica przebiega między promptami do 100000 tokenów a powyżej 100000; nie jest to cena naliczana tylko za tokeny ponad próg. Przed użyciem tych liczb w prognozie sprawdź aktualną dokumentację cen.

Kategoria tokenówPrompt do 100kPrompt powyżej 100k
Wejście bez cache$0.10$0.50
Wyjście$0.50$2.50
Zapis do cache na 5 minut$0.125$0.625
Zapis do cache na 1 godzinę$0.20$1.00
Odczyt z cache$0.01$0.05

Każda podana stawka za token jest powyżej progu pięciokrotnie wyższa. Nie oznacza to, że rachunek każdej aplikacji rośnie pięciokrotnie: wiele wywołań może pozostać krótkich, a na łączne wydatki wpływają objętość wyjścia, cache, narzędzia, przetwarzanie wsadowe, ponowienia i skuteczność zadań. Zbuforowany kontekst nadal zajmuje miejsce w prompcie; trafienie w cache nie zamienia żądania o długości 120k tokenów w krótki prompt.

Jak próg wygląda w pojedynczym żądaniu

Rozważmy dwa ilustracyjne wywołania bez cache i bez osobno rozliczanych narzędzi, każde generujące 1000 tokenów wyjścia. Prompt 99000 tokenów kosztuje około $0.0104 za wejście plus wyjście według stawek krótkich promptów. Prompt 101000 tokenów kosztuje około $0.0530 według stawek długich promptów. To mniej więcej pięć razy więcej za żądanie, które ma tylko 2000 tokenów wejścia więcej. Przykład utrzymuje stałe wyjście, by wyizolować granicę cenową; nie jest to zmierzona oszczędność produkcyjna. Rzeczywiste prompty zawierają też instrukcje systemowe, historię rozmowy, schematy narzędzi i wyniki narzędzi.

Przelicz przed migracją

Według notatek o migracji Anthropic ten sam tekst generuje na Haiku 5.5 około 30% więcej tokenów niż na Haiku 4.5, z różnicami zależnie od treści. Prompt, który przy starych liczbach tokenów mieścił się komfortowo poniżej 100k, może przekroczyć nowy próg. Nie mnóż wszystkich starych liczb przez 1,3 i nie traktuj tego jako prognozy faktury; przelicz reprezentatywne żądania na claude-haiku-5-5.

Punkt zliczania tokenów Anthropic przyjmuje ustrukturyzowaną wiadomość, prompt systemowy i obsługiwane narzędzia klienta przed wysłaniem żądania generowania. Licz na modelu docelowym, a potem zapisuj faktyczne zużycie po odpowiedzi. Zliczanie wstępne jest szacunkiem i może nieznacznie różnić się od rozliczanego wejścia; licznik nie obsługuje niektórych narzędzi serwerowych ani bloków URL i plików. Dla tych ścieżek opieraj się na zaobserwowanym zużyciu żądań i zachowaj margines bezpieczeństwa blisko progu.

Zasada budżetu promptów dla subagentów

  1. Zmierz rozkład. Zapisuj liczby tokenów promptu Haiku 5.5 według obciążenia, identyfikatora modelu i wyniku zadania. Patrz, ile wywołań skupia się przy 100k lub powyżej, a nie tylko na średniej.
  2. Ostrzegaj przed progiem. Oznaczaj w orkiestratorze agentów żądania bliskie progu. Traktuj poziom ostrzeżenia jako własny margines operacyjny, a nie regułę cenową Anthropic.
  3. Ogranicz przyczynę. Usuwaj zduplikowane fragmenty wyszukiwania, ogranicz rozmiar wyników narzędzi lub kompresuj nieaktualną historię, o ile pozwalają na to testy jakości. Nie odrzucaj dowodów, których agent potrzebuje tylko po to, by oszczędzić tokeny.
  4. Porównaj długi ogon. Dla nieuniknionych długich promptów przetestuj Haiku na wyższej taryfie względem innej ścieżki na tych samych zadaniach. Porównuj koszt za zaakceptowany wynik, opóźnienie i częstotliwość przejść awaryjnych, a nie same ceny katalogowe.
  5. Uzgodnij z fakturą. Wyceń rzeczywiste wejście, wyjście oraz odczyty i zapisy cache w odpowiedniej taryfie, a następnie dolicz narzędzia i ponowienia. Ponownie sprawdź stawki dostawcy lub platformy chmurowej oraz rabaty kontraktowe.

Haiku 5.5 może nadal być najlepszym wyborem powyżej 100k, ale powinna to być zmierzona decyzja routingu. Najważniejsza kontrola to wiedza, które żądania przekraczają granicę i dlaczego.

Pytania zadawane przez zespoły

Czy wyższa cena dotyczy tylko tokenów powyżej 100k?

Nie. Anthropic opisuje Haiku 5.5 jako wyceniany według długości promptu: prompt powyżej 100000 tokenów płaci za całe to żądanie opublikowane wyższe stawki.

Czy cache promptu może utrzymać długie żądanie w tańszej taryfie?

Nie. Ponownie użyte tokeny mogą otrzymać stawkę odczytu z cache, ale zbuforowany kontekst nadal zajmuje długość promptu. Przy sprawdzaniu progu licz cały prompt.

Czy wzrost o 30% w tokenizerze jest gwarantowany?

Nie. Anthropic podaje około 30% więcej tokenów dla tego samego tekstu niż w Haiku 4.5, zależnie od treści. Licz własne prompty na modelu docelowym.

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com