Znajdź cache miss, który stoi za rachunkiem OpenAI
Zaktualizowano September 26, 2026 · pierwsza publikacja September 26, 2026
Dashboard cache promptów może pokazać, że ponowne użycie spadło. Sam nie powie jednak, która zmiana w żądaniu spowodowała spadek ani ile kosztował. Wydanie OpenAI z 8 września 2026 udostępniło Prompt Cache Diagnostics ogólnie w Responses API dla GPT-5.6 i nowszych obsługiwanych modeli. Przydatny ruch FinOps to zamiana spadku tokenów z cache w krótkie, powtarzalne śledztwo.
Porównaj żądanie, które chybiło
Zapisz ID ostatniej zakończonej odpowiedzi, której prefiks miał zostać ponownie użyty. Przy kolejnym porównywalnym żądaniu do Responses API z tej samej organizacji ustaw prompt_cache_options.comparison_response_id na ten ID. Następnie odczytaj prompt_cache_diagnostics w nowej odpowiedzi razem z usage.input_tokens_details.cached_tokens. Opcja porównania zamawia diagnozę; nie wczytuje wcześniejszej rozmowy i nie zmienia działania cache. Przewodnik po diagnostyce OpenAI zawiera działające przykłady żądań.
const next = await client.responses.create({
model: model,
instructions: stableInstructions,
input: nextInput,
tools: stableTools,
prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);Fragment zakłada, że baseline to ostatnia zakończona odpowiedź, a pozostałe zmienne to dane Twojego żądania. Utrzymuj stabilny prefiks wystarczająco długi, by został zapisany w cache: OpenAI podaje minimum 1,024 tokeny dla GPT-5.6 i nowszych. Mały lub zupełnie inny prompt nie jest sensownym testem cache miss.
Napraw przyczynę, nie metrykę
Wynik cache_miss może wskazywać na zmieniony model, poziom usługi, definicje lub kolejność narzędzi, klucz cache, format odpowiedzi, poziom wysiłku rozumowania, verbosity albo skompresowany kontekst. Na przykład nieszkodliwie wyglądająca zmiana nazwy schematu narzędzia może unieważnić wielokrotnego użytku prefiks. Porównaj konfigurację żądania i pierwsze bajty promptu, przywróć stabilność tam, gdzie zmiana była przypadkowa, i powtórz porównanie względem tej samej bazy. OpenAI raportuje pierwszą znalezioną przyczynę, więc druga może pojawić się dopiero po pierwszej poprawce.
Nie wymuszaj trafienia, jeśli zmiana była zamierzona. Inny model może obniżyć całkowity koszt zadania, mimo utraty ponownego użycia cache; kompresja może zmniejszyć przyszły kontekst. Oceniaj całe żądanie i zadanie, a nie sam procent trafień cache. Wygasła baza albo wynik unavailable jest nierozstrzygający, a nie dowodem, że cache zawiódł.
Przełóż wynik na pieniądze
cache_missed_tokens szacuje utracone wielokrotnego użytku tokeny względem odpowiedzi porównawczej. To nie jest liczba rozliczonych tokenów. Wynik cache_hit również nie ustala oszczędności w dolarach. Aby poznać rzeczywisty koszt wejścia, zbierz dla każdej odpowiedzi sumę input_tokens, cached_tokens i cache_write_tokens, a następnie zastosuj aktualną stawkę dla tego modelu i poziomu przetwarzania. Dla GPT-5.6 i nowszych przewodnik po prompt caching OpenAI podaje, że odczyty z cache kosztują 0.1 stawki wejścia bez cache, a zapisy do cache 1.25 tej stawki.
ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000To są wzajemnie wykluczające się kategorie tokenów: nie dodawaj dopłaty za zapis do cache do tokenów już policzonych po stawce zapisu. Ten wzór obejmuje wyłącznie wejście; przy obliczaniu kosztu za udane zadanie uwzględnij wyjście, narzędzia, ponowienia i inne opłaty. Używaj aktualnego cennika dostawcy, a nie zakodowanej na sztywno ceny z artykułu.
Przydatny cotygodniowy przegląd
- Grupuj porównywalny ruch według obciążenia, modelu i poziomu usługi; zestaw udział tokenów z cache i koszt wejścia na ukończone zadanie na wykresie.
- Pobierz próbkę nagłej regresji, porównaj ją z ostatnią bazą i zapisz przyczynę z diagnostyki oraz odpowiedzialną zmianę w kodzie.
- Napraw przypadkowy dryf prefiksu lub konfiguracji; zachowaj zamierzone zmiany jakości lub routingu, jeśli poprawia się całkowita ekonomika zadania.
- Zweryfikuj wynik na reprezentatywnym ruchu produkcyjnym i uzgodnij zaobserwowane oszczędności z rozliczeniem.
Same diagnostyki nie kosztują dodatkowej opłaty za funkcję, ale dodatkowe żądania testowe są normalnie rozliczane. Zyskiem nie jest ładniejszy wykres współczynnika trafień. Jest nim obronne wyjaśnienie, dlaczego koszt wejścia danego obciążenia się zmienił i czy proponowana poprawka rzeczywiście obniżyła rachunek.
Pytania zadawane przez zespoły
Czy diagnoza cache hit dowodzi, że żądanie było tańsze?
Nie. Oznacza tylko, że względem wybranej bazy nie wykryto cache miss. Przed twierdzeniem o oszczędnościach sprawdź rzeczywiste cached_tokens i kategorie tokenów z cenami w żądaniu.
Czy diagnostyka może porównać dowolne dwa żądania OpenAI?
Nie. Użyj ostatniej zakończonej bazy z tej samej organizacji i oczekuj tego przepływu tylko dla obsługiwanych modeli Responses API w wersji GPT-5.6 lub nowszej. Rekord porównania może wygasnąć.
Czy każdy cache miss powinien zostać usunięty?
Nie. Zmiana modelu, inny poziom usługi lub skompresowany kontekst mogą być zamierzone. Porównaj jakość, opóźnienie i koszt na udane zadanie, zanim cofniesz zmianę.
Powiązane
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →