Przejdź do treści

Płacenie dwa razy za okno kontekstu

Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026

Krótka odpowiedź: Okno kontekstu jest reklamowane jako pojemność: 200,000 tokenów, milion tokenów, miejsce na wszystko, czego potrzebujesz. Pojemność nie jest jednostką rozliczeniową. Płacisz za to, co wysyłasz, a w...

Okno kontekstu jest reklamowane jako pojemność: 200,000 tokenów, milion tokenów, miejsce na wszystko, czego potrzebujesz. Pojemność nie jest jednostką rozliczeniową. Płacisz za to, co wysyłasz, a w rozmowie wieloturowej wysyłasz prawie wszystko ponownie w każdej turze.

To jest druga płatność. Dokument o długości 30,000 tokenów załadowany na początku dwudziestoturowej rozmowy to nie 30,000 tokenów wejścia. To bliżej 600,000, bo tura druga wysyła go ponownie, podobnie jak tura dwudziesta.

Rachunek, którego nikt nie robi

Koszt rośnie z kwadratem długości rozmowy, a nie liniowo. Podwojenie liczby tur mniej więcej poczterokrotnia tokeny wejścia, o ile kontekst ciągle się narasta. Zespoły, które modelują "koszt na wiadomość" i mnożą przez liczbę wiadomości, bardzo nie doszacowują długich sesji, a błąd rośnie właśnie u tych użytkowników, których najbardziej chcesz zatrzymać.

Często dochodzi trzecia opłata: wielu dostawców liczy wyższą stawkę za żądania powyżej progu długiego kontekstu. Jeden dodatkowy załącznik może przekroczyć tę granicę i przeliczyć cały wywołanie, zarówno wejście, jak i wyjście, a nie tylko tokeny, które ją przekroczyły.

Co mierzyć

Śledź wykorzystanie kontekstu: tokeny wysłane kontra tokeny, których model faktycznie potrzebował. To najbliższa rzecz do metryki marnotrawstwa w tej dziedzinie. Śledź tokeny wejścia na rozmowę, a nie na żądanie, i obserwuj p99 — tam znajdują się sesje, które kosztują dwadzieścia razy więcej niż mediana.

Ustaw alerty dla żądań przekraczających próg cenowy długiego kontekstu. To skok, a nie gradient, i w dziennej sumie nie będzie wyglądał na nic szczególnego.

Trzy poprawki, od najtańszej

Keszuj stabilny prefiks. Jeśli prompt systemowy i załadowane dokumenty nie zmieniają się w trakcie rozmowy, cache promptów zamienia powtarzany koszt w jego ułamek. To pojedyncza zmiana o największym zwrocie w każdym produkcie wieloturowym.

Przycinaj historię celowo. Starsze tury rzadko zarabiają na swoją ponowną wysyłkę. Podsumuj wcześniejszą część długiej rozmowy i usuń surowe tury; zachowujesz wątek i przestajesz płacić pełną stawkę za resztę.

Wysyłaj fragment, a nie cały korpus. Do tego właśnie służy wyszukiwanie. To, że okno jest na tyle duże, by pomieścić cały dokument, nie jest argumentem za wkładaniem tam całego dokumentu.

Powiązane

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com