Przejdź do treści

Narzędzia serwerowe to osobna faktura

Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026

Krótka odpowiedź: Większość modeli kosztów LLM ma jeden licznik: tokeny wejściowe, tokeny wyjściowe, cena za milion. Ten model był poprawny, gdy jedyne, co robiło zapytanie, to generowanie tekstu. Przestał być poprawny...

Większość modeli kosztów LLM ma jeden licznik: tokeny wejściowe, tokeny wyjściowe, cena za milion. Ten model był poprawny, gdy jedyne, co robiło zapytanie, to generowanie tekstu. Przestał być poprawny w chwili, gdy pojawiły się narzędzia po stronie serwera.

Wyszukiwanie w sieci, pobieranie stron i wykonywanie kodu działają na infrastrukturze dostawcy, a kilka z nich ma własną opłatę za użycie oprócz tokenów, które generują. Pojedyncza tura agenta może więc naliczyć ci dwa razy: raz za wykonane wyszukiwania i drugi raz za tokeny, które wyniki dołożyły do kontekstu.

Część, która się kumuluje

Drugiej opłaty ludzie najczęściej nie widzą. Każdy wynik narzędzia jest dopisywany do rozmowy, a każda kolejna tura wysyła całość ponownie jako wejście. Dziesięć wyszukiwań na początku długiego przebiegu agenta to nie dziesięć opłat, tylko dziesięć opłat plus ich ładunki, odczytywane ponownie w każdej kolejnej turze.

Dlatego koszty agenta wyglądają na nieliniowe, choć arytmetyka tokenów mówi, że powinny być liniowe. Opłata za użycie jest widoczną częścią; wzrost kontekstu, który ją powoduje, jest większą częścią i ląduje w linii tokenów wejściowych bez żadnej etykiety wskazującej narzędzie.

Przypisz koszt, inaczej nim nie zarządzisz

Zapisuj wywołania narzędzi dla każdego żądania obok obiektu usage: które narzędzie, ile razy i jaki rozmiar w tokenach dodał każdy wynik. Ostatnie pole jest tym, które czyni kumulację widoczną, i to właśnie ono domyślnie nie jest zapisywane.

Następnie licz koszt na przebieg agenta, a nie na wywołanie API. Przebieg to to, co użytkownik faktycznie uruchomił; wywołanie jest jedną z dwudziestu rzeczy, które ten przebieg zrobił. Każda liczba budżetowa przypisana do wywołania zamiast do przebiegu będzie błędna w kierunku, który ci schlebia.

Trzy kontrole, które naprawdę działają

Ogranicz wywołania narzędzi na przebieg. Twardy limit wyszukiwań lub pobrań na żądanie użytkownika ogranicza obie opłaty naraz. Większość obciążeń, które trafiają w limit dziesięciu, zapętlała się, zamiast badać.

Skracaj to, co wchodzi do kontekstu. Rzadko potrzebujesz całej pobranej strony. Streszczenie lub przycięcie wyniku przed dopisaniem tnie każdą kolejną turę, nie tylko bieżącą.

Buforuj stały prefiks. Jeśli prompt systemowy i definicje narzędzi są stałe w czasie przebiegu, a zwykle są, cache promptu usuwa największy powtarzany koszt, jaki narzędzia stworzyły.

Zanim cokolwiek z tego zamodelujesz, sprawdź aktualny cennik dostawcy: które narzędzia są płatne za użycie i w jakiej stawce, bo różni się to w zależności od narzędzia i zmienia się w czasie. Punkt strukturalny pozostaje ten sam: licznik tokenów nie jest już całym rachunkiem.

Powiązane

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com