Przejdź do treści

Ile kosztują przebiegi guardrail i moderacji

Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026

Krótka odpowiedź: Produkcyjna funkcja LLM rzadko wykonuje jedno wywołanie modelu. Wykonuje wywołanie, które zaprojektowano, a potem jedno lub więcej wywołań dodanych później dla bezpieczeństwa: klasyfikator wejścia,...

Produkcyjna funkcja LLM rzadko wykonuje jedno wywołanie modelu. Wykonuje wywołanie, które zaprojektowano, a potem jedno lub więcej wywołań dodanych później dla bezpieczeństwa: klasyfikator wejścia, kontrolę wyjścia, sędziego zgodności z polityką, czasem drugi model oceniający pierwszy. Każde z nich to inferencja, a inferencja jest rozliczana.

Mnożnik jest większy, niż wygląda

Policzmy przebiegi uczciwie. Moderacja wejścia czyta pełne dane użytkownika. Moderacja wyjścia czyta całą wygenerowaną odpowiedź. Sędzia polityki lub zgodności z kontekstem zwykle czyta obie części, do tego pobrany kontekst i rubrykę — przez co wywołanie sędziego jest większe niż wywołanie, które ocenia. Dodajmy klasyfikator jailbreaków i skan danych osobowych, a pojedyncze żądanie użytkownika staje się pięcioma wywołaniami inferencji.

Koszty nie są równe. Dedykowane endpointy moderacji są u części dostawców tanie lub darmowe. Model ogólnego przeznaczenia użyty jako sędzia już taki nie jest: jest wyceniany jak każde inne wywołanie, a ocena długiej odpowiedzi według długiej rubryki to długie wywołanie.

Gdzie tak naprawdę narasta wydatek

Dominują trzy wzorce. Ocenianie modelem z najwyższej półki, bo najłatwiej było użyć tego samego klienta — klasyfikacja to zadanie, w którym mały model rzeczywiście wystarcza, i często jest to największa dostępna oszczędność. Sprawdzanie przy każdej turze długiej rozmowy, z ponownym skanowaniem historii, która już została przepuszczona. Oraz guardrail na ruchu wewnętrznym, gdzie harness ewaluacyjny lub narzędzie wewnętrzne dziedziczy pełny stos bezpieczeństwa dla klientów, którego nie potrzebuje.

Ujmij to w budżecie jako osobną pozycję, a nie jako zaokrąglenie

Chodzi nie o usunięcie kontroli. Chodzi o to, że stos bezpieczeństwa może stanowić 30–50% kosztu inferencji funkcji, a mimo to nie pojawia się w planie, bo wszyscy policzyli model, który odpowiada, a nikt nie policzył modeli, które sprawdzają.

Oznaczaj wywołania guardrail osobnym tagiem w telemetrii, żeby ten stosunek był widoczny. Następnie używaj najtańszego modelu, który zachowuje wymaganą dokładność, sprawdzaj nową treść zamiast całych historii i decyduj dla każdej powierzchni, które kontrole faktycznie wymaga dany rodzaj ruchu.

Powiązane

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com