Jak styl promptu wpływa na rachunek
Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026
Prompty rosną tak, jak rosną pliki konfiguracyjne. Ktoś dodaje instrukcję, żeby naprawić błąd. Ktoś inny dorzuca przykład. Trzecia osoba dopisuje akapit, który tłumaczy, dlaczego druga instrukcja jest ważna. Niczego się nie usuwa, bo usunięcie mogłoby przywrócić błąd, którego nikt nie umie odtworzyć. Po sześciu miesiącach system prompt ma trzy tysiące tokenów i nikt nie potrafi wskazać, które dwieście z nich są istotne.
Dlaczego to się kumuluje
W przeciwieństwie do wyjścia, które zmienia się wraz z zadaniem, narzut promptu płaci się przy każdym żądaniu, identycznie, zawsze. Tysiąc zbędnych tokenów w funkcji obsługującej dziesięć milionów wywołań miesięcznie to dziesięć miliardów tokenów miesięcznie samego formatowania.
W rozmowach wieloturowych jest gorzej: system prompt wysyła się ponownie przy każdej turze, więc jego koszt rośnie wraz z liczbą tur, a nie żądań. W pętlach agentów jedna akcja użytkownika może uruchomić kilkanaście wywołań modelu, i ta sama rozdęta preambuła jest rozliczany kilkanaście razy za jedną pracę.
Co jest naprawdę marnotrawstwem
Nie grzeczność, która to kilka tokenów i czasem poprawia zgodność z poleceniem. Największy ciężar niosą: nadmiarowe instrukcje, które powtarzają tę samą zasadę na trzy sposoby, zabezpieczający boilerplate dodany dla generacji modeli, która już go nie potrzebuje, przykłady dublujące się zamiast pokrywać różne przypadki, oraz wyjaśnienia skierowane do ludzi czytających plik promptu, a nie do modelu.
Ostatnia kategoria jest w praktyce największa. Przykłady few-shot są drogie w przeliczeniu na token, a zespoły rzadko sprawdzają, czy pięć przykładów robi coś, co zrobiłyby dwa.
Traktuj prompt jak kod z budżetem
Zmierz stały narzut promptu jako udział w średnim rozmiarze żądania. Jeśli przekracza połowę, to problem kosztowy, a nie kwestia stylu. Umieść stabilną część na początku, żeby działał cache, co sprawia, że reszta bałaganu jest dużo tańsza bez usuwania czegokolwiek. Potem zrób ablację: usuń jeden blok, uruchom swoje evale i zostaw usunięcie, jeśli jakość się utrzymuje. Przycinanie promptu bez zestawu evali to zgadywanie, a tryb awarii, czyli regresja jakości wykryta przez klientów, kosztuje więcej niż zaoszczędzone tokeny.
Powiązane
Powiązane
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →