Przejdź do treści

98% tokenów wejściowych Codexa było w cache. Bez cache rachunek byłby 12 razy wyższy

Zaktualizowano October 9, 2026 · pierwsza publikacja October 9, 2026

Krótka odpowiedź: W ciągu 12 dni intensywnego używania Codexa w planie ChatGPT Pro $100 wysłaliśmy 13.0 mld tokenów wejściowych i otrzymaliśmy 47 mln tokenów wyjściowych. 97.6% tego wejścia było trafieniem w cache....

W ciągu 12 dni intensywnego używania Codexa w planie ChatGPT Pro $100 wysłaliśmy 13.0 mld tokenów wejściowych i otrzymaliśmy 47 mln tokenów wyjściowych. 97.6% tego wejścia było trafieniem w cache. Według cen API OpenAI praca kosztowała $1,211. Gdyby te same tokeny nie trafiały w cache, wyceniono by je na $14,198, czyli 12 razy więcej.

Wartość API 12 dni Codexa według modelu: z cache i bez cache$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraPomarańczowy: to, co zapłaciliśmy w cenach API, z cacheNiebieski: te same tokeny bez trafień w cache
Wartość API 12 dni Codexa według modelu: z cache i bez cache

Dlaczego prawie całe wejście agentów kodujących idzie z cache

Pętla agenta wysyła całą rozmowę ponownie przy każdym kroku: prompt systemowy, definicje narzędzi, pliki, które przeczytał, i każdy wcześniejszy wynik narzędzia. Każdy krok dokłada trochę i ponownie czyta wszystko. Wejście rośnie więc z kwadratem długości sesji, a wyjście pozostaje małe. W ciągu 12 dni dało to stosunek wejścia do wyjścia 279:1.

Cache promptów sprawia, że to w ogóle się opłaca. Wejście z cache w API OpenAI kosztuje jedną dziesiątą normalnego wejścia lub mniej. GPT-6 Sol, który wykonał większość naszej pracy, pobiera $2 za milion tokenów wejściowych i $0.10 za milion tokenów z cache.

Dokąd poszły pieniądze

ModelTokeny wejścioweW cacheTokeny wyjścioweWartość APIBez cache
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Razem13.01B97.6%47M$1,211$14,198
Składnik kosztuWartość APIUdział
Wejście z cache$72860%
Wejście bez cache$28824%
Wyjście$19616%

Nawet przy 95% zniżce wejście z cache jest największą pozycją. To sygnatura obciążenia agenta: najtańszy typ tokenów, w ogromnej ilości. Sumy dla poszczególnych modeli są w codex-pro-100-model-mix.csv.

Co psuje cache

Trafienie w cache wymaga identycznego prefiksu. Każda zmiana na początku kontekstu wymusza ponowne odczytanie po pełnej cenie wszystkiego, co za nią następuje.

Dlaczego to ma znaczenie dla twoich limitów Codexa

Jeśli licznik Codexa waży wejście z cache blisko jego ceny API, spadek trafień w cache o 1 punkt jest drogi. Przy naszym wolumenie, gdyby Sol spadł z 98.1% do 90% w cache, dodałoby to około $1,004 samego wejścia Sol, mniej więcej 6 dodatkowych okien Pro $100. Dyscyplina cache to dyscyplina limitów. Co mieści się w jednym oknie, opisuje nasz pomiar mnożnika Pro $100; jak w 12 dni dostaliśmy osiem okien, opisuje dziennik resetów.

Jak to mierzyliśmy

Codex zapisuje dziennik JSONL każdej sesji w ~/.codex/sessions/. Każde żądanie rejestruje skumulowane wejście, wejście z cache i wyjście, a także tygodniowy licznik (used_percent) i czas resets_at. Deltę tokenów każdego żądania wyceniliśmy po cenie listowej API modelu, na którym działało, i pogrupowaliśmy żądania według tygodniowego okna. Kwoty w dolarach to wartość równoważna API, a nie pieniądze, które faktycznie zapłaciliśmy.

Źródła

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com