98% tokenów wejściowych Codexa było w cache. Bez cache rachunek byłby 12 razy wyższy
Zaktualizowano October 9, 2026 · pierwsza publikacja October 9, 2026
W ciągu 12 dni intensywnego używania Codexa w planie ChatGPT Pro $100 wysłaliśmy 13.0 mld tokenów wejściowych i otrzymaliśmy 47 mln tokenów wyjściowych. 97.6% tego wejścia było trafieniem w cache. Według cen API OpenAI praca kosztowała $1,211. Gdyby te same tokeny nie trafiały w cache, wyceniono by je na $14,198, czyli 12 razy więcej.
- Stosunek wejścia do wyjścia: około 279 tokenów wejściowych na każdy token wyjściowy.
- Udział wejścia z cache w rachunku: 60%, mimo 95% zniżki.
- Udział wyjścia w rachunku: 16%.
Dlaczego prawie całe wejście agentów kodujących idzie z cache
Pętla agenta wysyła całą rozmowę ponownie przy każdym kroku: prompt systemowy, definicje narzędzi, pliki, które przeczytał, i każdy wcześniejszy wynik narzędzia. Każdy krok dokłada trochę i ponownie czyta wszystko. Wejście rośnie więc z kwadratem długości sesji, a wyjście pozostaje małe. W ciągu 12 dni dało to stosunek wejścia do wyjścia 279:1.
Cache promptów sprawia, że to w ogóle się opłaca. Wejście z cache w API OpenAI kosztuje jedną dziesiątą normalnego wejścia lub mniej. GPT-6 Sol, który wykonał większość naszej pracy, pobiera $2 za milion tokenów wejściowych i $0.10 za milion tokenów z cache.
Dokąd poszły pieniądze
| Model | Tokeny wejściowe | W cache | Tokeny wyjściowe | Wartość API | Bez cache |
|---|---|---|---|---|---|
| Sol | 6.56B | 98.1% | 17.5M | $1,073 | $13,299 |
| Luna | 6.41B | 97.2% | 29.0M | $95 | $655 |
| GPT-5.5 | 0.03B | 93.5% | 0.2M | $27 | $144 |
| Astra | 0.01B | 94.5% | 0.0M | $16 | $99 |
| Razem | 13.01B | 97.6% | 47M | $1,211 | $14,198 |
| Składnik kosztu | Wartość API | Udział |
|---|---|---|
| Wejście z cache | $728 | 60% |
| Wejście bez cache | $288 | 24% |
| Wyjście | $196 | 16% |
Nawet przy 95% zniżce wejście z cache jest największą pozycją. To sygnatura obciążenia agenta: najtańszy typ tokenów, w ogromnej ilości. Sumy dla poszczególnych modeli są w codex-pro-100-model-mix.csv.
Co psuje cache
Trafienie w cache wymaga identycznego prefiksu. Każda zmiana na początku kontekstu wymusza ponowne odczytanie po pełnej cenie wszystkiego, co za nią następuje.
- Zmiana modelu w trakcie sesji. Nowy model nie ma cache dla twojego kontekstu.
- Edycja instrukcji lub list narzędzi w trakcie sesji. Znajdują się na górze promptu, więc wszystko poniżej jest czytane od nowa.
- Długie przerwy. Cache wygasa. Powrót po przerwie czyta sesję od nowa po pełnej cenie.
- Kompakcja. Podsumowanie historii przepisuje prefiks. Oszczędza tokeny później, ale kosztuje jedno przejście bez cache teraz.
Dlaczego to ma znaczenie dla twoich limitów Codexa
Jeśli licznik Codexa waży wejście z cache blisko jego ceny API, spadek trafień w cache o 1 punkt jest drogi. Przy naszym wolumenie, gdyby Sol spadł z 98.1% do 90% w cache, dodałoby to około $1,004 samego wejścia Sol, mniej więcej 6 dodatkowych okien Pro $100. Dyscyplina cache to dyscyplina limitów. Co mieści się w jednym oknie, opisuje nasz pomiar mnożnika Pro $100; jak w 12 dni dostaliśmy osiem okien, opisuje dziennik resetów.
Jak to mierzyliśmy
Codex zapisuje dziennik JSONL każdej sesji w ~/.codex/sessions/. Każde żądanie rejestruje skumulowane wejście, wejście z cache i wyjście, a także tygodniowy licznik (used_percent) i czas resets_at. Deltę tokenów każdego żądania wyceniliśmy po cenie listowej API modelu, na którym działało, i pogrupowaliśmy żądania według tygodniowego okna. Kwoty w dolarach to wartość równoważna API, a nie pieniądze, które faktycznie zapłaciliśmy.
Źródła
Powiązane
- ChatGPT Pro $100 to w praktyce 2.6x Plus
- 8 tygodniowych okien Codexa w 12 dni
- Resety Codexa zamieniły $40 w $1,211
- Ile Codexa zawiera ChatGPT Pro
- Claude Max 20x kontra ChatGPT Pro
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →