Wyszukiwanie w sieci jako centrum kosztów agentów
Zaktualizowano September 10, 2026 · pierwsza publikacja September 10, 2026
Agenci przechodzą od statycznej wiedzy do badania sieci na żywo, a to zmienia model kosztów. Pojedyncze zapytanie użytkownika może teraz uruchomić kilka wyszukiwań, wywołanie modelu do interpretacji każdego wyniku, ponowienia po błędach narzędzi i końcową syntezę. Warstwa wyszukiwania nie jest już niewidoczną infrastrukturą; to osobno rozliczana część zadania.
Amazon Bedrock AgentCore, na przykład, dokumentuje Web Search jako możliwość rozliczaną za użycie, po 7 dolarów za 1000 zapytań. Dokładna cena zależy od dostawcy i produktu, ale lekcja dla FinOps jest uniwersalna: wywołania narzędzi należy liczyć jako płatną pracę obok tokenów wejścia i wyjścia. Aktualny przykład znajdziesz w ogłoszeniu AWS.
Jedno zapytanie może zamienić się w wiele wyszukiwań
Wzmocnienie liczby wyszukiwań bierze się z planowania. Agent może przeformułować pytanie, przeszukać kilka źródeł, podążyć za wynikiem, ponowić próbę po przekroczeniu limitu czasu i szukać ponownie po znalezieniu sprzecznych dowodów. Jeśli aplikacja raportuje tylko pierwotny prompt użytkownika, finanse widzą funkcję o niskim wolumenie, podczas gdy dostawca widzi duże obciążenie narzędziami.
Zapisuj identyfikator zadania nadrzędnego, dostawcę wyszukiwania, liczbę zapytań, pobrania wyników, liczbę ponowień oraz to, czy wynik zmienił końcową odpowiedź. Następnie oblicz koszt wyszukiwania na udane zadanie. Wyszukiwanie, które nigdy nie przyczynia się do użytecznej odpowiedzi, jest kandydatem do zmiany polityki, a nie tylko pozycją, którą można zaakceptować.
Kontroluj budżet wyszukiwania
- Ustaw maksymalny budżet zapytań na zadanie i na poziom użytkownika.
- Użyj tańszego pierwszego przebiegu do odkrywania, a głębokie badania zarezerwuj dla zadań o wysokiej wartości.
- Cachuj stabilne zapytania i normalizuj nieszkodliwe różnice w sformułowaniu.
- Zatrzymuj się, gdy osiągnięty zostanie próg dowodów, zamiast pozwalać planerowi dalej eksplorować.
- Stosuj wykładnicze opóźnienia ponowień i ogranicz je niezależnie od ponowień wywołań modelu.
Mierz świeżość w relacji do wydatków
Świeżość ma wartość tylko wtedy, gdy zmienia decyzję. Porównuj jakość odpowiedzi i sukces zadań przy różnych głębokościach wyszukiwania: bez wyszukiwania, z jednym wyszukiwaniem i z ograniczonym wieloma wyszukiwaniami. Niektóre procesy wymagają aktualnych informacji; inne płacą za wielokrotne pobieranie faktów, które zmieniają się powoli.
Raportuj razem trzy liczby: koszt modelu, koszt wyszukiwania i koszt na udane zadanie. Dzięki temu tańszy model nie będzie wyglądał na efektywny, gdy rekompensuje to dużą liczbą płatnych wyszukiwań. Zespoły produktowe dostają też uzasadniony sposób na decyzję, kiedy połączenie z siecią na żywo jest warte dopłaty.
Powiązane
Powiązane
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →