Przejdź do treści

Adaptacyjne myślenie i prognozowanie kosztów

Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026

Krótka odpowiedź: Budżet na rozumowanie był kiedyś liczbą, którą ustawiało się samemu. Przekazywało się thinking: {type: "enabled", budget_tokens: N}, a N było jednocześnie limitem i prognozą: w najgorszym...

Budżet na rozumowanie był kiedyś liczbą, którą ustawiało się samemu. Przekazywało się thinking: {type: "enabled", budget_tokens: N}, a N było jednocześnie limitem i prognozą: w najgorszym przypadku każde zapytanie kosztowało N tokenów rozumowania, więc dział finansów mógł po prostu to pomnożyć.

Ten parametr jest wycofany w Opus 4.6 i Sonnet 4.6, a w najnowszych modelach — Fable 5 i 5.1, Sonnet 5, Opus 5, 4.8 i 4.7 — jego wysłanie zwraca 400. Zastępuje go thinking: {type: "adaptive"}, w którym model sam decyduje, ile myśleć, w zależności od trudności zapytania.

Średnio daje to lepszy wynik na dolara. To jednak także usunięcie sufitu, a jeśli prognoza była oparta na tym suficie, jest teraz błędna w sposób, który ujawni się dopiero po zamknięciu miesiąca.

Co zmienia się w liczbach

Średni koszt na zapytanie zwykle spada, bo proste zapytania przestają płacić za rozumowanie, którego nie potrzebowały. Wariancja rośnie, bo trudne zapytania nie są już ucinane na Twoim limicie. Te dwa efekty idą w przeciwnych kierunkach, a budżet wyrażony jako maksimum na zapytanie nie ma już do czego się odnieść.

Praktyczny problem to nie średnia, tylko ogon: zmiana promptu, nowy typ dokumentu albo użytkownicy zadający trudniejsze pytania przenoszą część ruchu na głębsze rozumowanie, a w konfiguracji nic tego nie ogranicza.

Prognozuj rozkład, nie limit

Trzy zmiany, od tej, która daje najwięcej.

Śledź tokeny rozumowania jako osobną serię. Są już w obiekcie usage każdej odpowiedzi. Oddziel je od wejścia i wyjścia w telemetrii, a zobaczysz przesunięcie tego samego dnia, zamiast na koniec miesiąca.

Buduj budżet na percentylach. Zamiast "N tokenów na zapytanie" ustaw p50 i p99 dla każdej trasy. p50 pokazuje, ile kosztuje obciążenie; różnica między p50 a p99 pokazuje, jak bardzo jesteś narażony na zły tydzień.

Alarmuj na proporcję, nie na sumę. Udział tokenów rozumowania w łącznej liczbie tokenów dla danej trasy to liczba, która rusza się jako pierwsza, gdy zmiana promptu sprawia, że model pracuje mocniej. Alert na łączne wydatki odpala dni później, gdy wolumen już się nawarstwi.

Gdzie nadal potrzebny jest limit

Usunięcie pokrętła na zapytanie nie oznacza usunięcia wszystkich limitów. Limity wydatków na poziomie trasy i najemcy nadal działają, nadal łapią niekontrolowane pętle i to tam powinna teraz być bariera — na granicy, którą posiadasz, a nie w parametrze żądania, którego już nie ma. W ścieżkach wrażliwych na opóźnienia, gdzie głębokie rozumowanie nigdy się nie opłaca, dźwignią jest wybór modelu, a nie budżet tokenów.

Powiązane

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com