Ile kosztują przebiegi guardrail i moderacji
Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026
Produkcyjna funkcja LLM rzadko wykonuje jedno wywołanie modelu. Wykonuje wywołanie, które zaprojektowano, a potem jedno lub więcej wywołań dodanych później dla bezpieczeństwa: klasyfikator wejścia, kontrolę wyjścia, sędziego zgodności z polityką, czasem drugi model oceniający pierwszy. Każde z nich to inferencja, a inferencja jest rozliczana.
Mnożnik jest większy, niż wygląda
Policzmy przebiegi uczciwie. Moderacja wejścia czyta pełne dane użytkownika. Moderacja wyjścia czyta całą wygenerowaną odpowiedź. Sędzia polityki lub zgodności z kontekstem zwykle czyta obie części, do tego pobrany kontekst i rubrykę — przez co wywołanie sędziego jest większe niż wywołanie, które ocenia. Dodajmy klasyfikator jailbreaków i skan danych osobowych, a pojedyncze żądanie użytkownika staje się pięcioma wywołaniami inferencji.
Koszty nie są równe. Dedykowane endpointy moderacji są u części dostawców tanie lub darmowe. Model ogólnego przeznaczenia użyty jako sędzia już taki nie jest: jest wyceniany jak każde inne wywołanie, a ocena długiej odpowiedzi według długiej rubryki to długie wywołanie.
Gdzie tak naprawdę narasta wydatek
Dominują trzy wzorce. Ocenianie modelem z najwyższej półki, bo najłatwiej było użyć tego samego klienta — klasyfikacja to zadanie, w którym mały model rzeczywiście wystarcza, i często jest to największa dostępna oszczędność. Sprawdzanie przy każdej turze długiej rozmowy, z ponownym skanowaniem historii, która już została przepuszczona. Oraz guardrail na ruchu wewnętrznym, gdzie harness ewaluacyjny lub narzędzie wewnętrzne dziedziczy pełny stos bezpieczeństwa dla klientów, którego nie potrzebuje.
Ujmij to w budżecie jako osobną pozycję, a nie jako zaokrąglenie
Chodzi nie o usunięcie kontroli. Chodzi o to, że stos bezpieczeństwa może stanowić 30–50% kosztu inferencji funkcji, a mimo to nie pojawia się w planie, bo wszyscy policzyli model, który odpowiada, a nikt nie policzył modeli, które sprawdzają.
Oznaczaj wywołania guardrail osobnym tagiem w telemetrii, żeby ten stosunek był widoczny. Następnie używaj najtańszego modelu, który zachowuje wymaganą dokładność, sprawdzaj nową treść zamiast całych historii i decyduj dla każdej powierzchni, które kontrole faktycznie wymaga dany rodzaj ruchu.
Powiązane
Powiązane
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →