Zum Inhalt springen

Den Cache-Miss hinter Ihrer OpenAI-Rechnung finden

Aktualisiert September 26, 2026 · erstveröffentlicht September 26, 2026

Kurzantwort: Ein Prompt-Cache-Dashboard kann Ihnen sagen, dass die Wiederverwendung gesunken ist. Es kann Ihnen von sich aus nicht sagen, welche Änderung an der Anfrage den Rückgang verursacht hat oder wie viel er...

Ein Prompt-Cache-Dashboard kann Ihnen sagen, dass die Wiederverwendung gesunken ist. Es kann Ihnen von sich aus nicht sagen, welche Änderung an der Anfrage den Rückgang verursacht hat oder wie viel er gekostet hat. Mit dem Release vom 8. September 2026 hat OpenAI Prompt Cache Diagnostics in der Responses API für GPT-5.6 und später unterstützte Modelle allgemein verfügbar gemacht. Der nützliche FinOps-Schritt besteht darin, einen Rückgang der gecachten Tokens in eine kurze, wiederholbare Untersuchung zu verwandeln.

Die Anfrage mit dem Miss vergleichen

Speichern Sie die ID einer aktuellen, abgeschlossenen Antwort, deren Präfix Sie wiederverwendet erwartet hatten. Setzen Sie bei der nächsten vergleichbaren Anfrage an die Responses API derselben Organisation prompt_cache_options.comparison_response_id auf diese ID. Lesen Sie dann prompt_cache_diagnostics in der neuen Antwort, zusammen mit usage.input_tokens_details.cached_tokens. Die Vergleichsoption fordert eine Diagnose an; sie lädt die frühere Konversation nicht und ändert das Cache-Verhalten nicht. Der Diagnostics-Leitfaden von OpenAI enthält funktionierende Anfragebeispiele.

const next = await client.responses.create({
  model: model,
  instructions: stableInstructions,
  input: nextInput,
  tools: stableTools,
  prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);

Das Snippet setzt voraus, dass baseline eine aktuelle, abgeschlossene Antwort ist und die übrigen Variablen Ihre eigenen Anfragedaten sind. Halten Sie ein stabiles Präfix, das lang genug zum Cachen ist: OpenAI dokumentiert für GPT-5.6 und später ein Minimum von 1,024 Tokens. Ein kleiner oder grundlegend anderer Prompt ist kein aussagekräftiger Cache-Miss-Test.

Die Ursache beheben, nicht die Kennzahl

Ein cache_miss-Ergebnis kann auf ein geändertes Modell, einen anderen Service-Tier, geänderte Tool-Definitionen oder deren Reihenfolge, den Cache-Schlüssel, das Antwortformat, den Reasoning-Aufwand, die Ausführlichkeit oder komprimierten Kontext hindeuten. Zum Beispiel kann die harmlos wirkende Umbenennung eines Tool-Schemas das wiederverwendbare Präfix ungültig machen. Vergleichen Sie die Anfragekonfiguration und die frühesten Prompt-Bytes, stellen Sie die Stabilität dort wieder her, wo die Änderung versehentlich war, und führen Sie den Vergleich erneut gegen dieselbe Baseline aus. OpenAI meldet die erste gefundene Ursache, daher kann nach der ersten Korrektur eine weitere auftauchen.

Erzwingen Sie keinen Treffer, wenn die Änderung bewusst erfolgte. Ein anderes Modell kann die Gesamtkosten der Aufgabe senken, auch wenn die Cache-Wiederverwendung verloren geht; Komprimierung kann den künftigen Kontext verkleinern. Bewerten Sie die gesamte Anfrage und Aufgabe, nicht die Cache-Trefferquote isoliert. Eine abgelaufene Baseline oder ein unavailable-Ergebnis ist nicht aussagekräftig und kein Beweis dafür, dass das Caching versagt hat.

Den Befund in Geld übersetzen

cache_missed_tokens schätzt die verlorenen wiederverwendbaren Tokens relativ zur Vergleichsantwort. Das ist keine Zahl abgerechneter Tokens. Ein cache_hit-Ergebnis belegt ebenfalls keine Dollar-Einsparung. Für die realisierten Input-Kosten erfassen Sie pro Antwort die Summen von input_tokens, cached_tokens und cache_write_tokens und wenden dann den aktuellen Tarif für dieses Modell und diese Verarbeitungsstufe an. Für GPT-5.6 und später gibt der Prompt-Caching-Leitfaden von OpenAI an, dass Cache-Lesezugriffe das 0.1-Fache des ungecachten Input-Tarifs und Cache-Schreibzugriffe das 1.25-Fache dieses Tarifs kosten.

ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000

Das sind sich ausschließende Token-Kategorien: Addieren Sie keinen Cache-Write-Aufschlag auf Tokens, die bereits zum Schreibtarif gezählt wurden. Diese Formel deckt nur den Input ab; beziehen Sie bei der Berechnung der Kosten pro erfolgreicher Aufgabe Output, Tools, Wiederholungen und weitere Gebühren ein. Verwenden Sie die aktuelle Preisliste des Anbieters statt eines fest eingetragenen Preises aus diesem Artikel.

Ein nützlicher wöchentlicher Check

  1. Gruppieren Sie vergleichbaren Traffic nach Workload, Modell und Service-Tier; stellen Sie den Anteil gecachter Tokens und die Input-Kosten pro abgeschlossener Aufgabe dar.
  2. Ziehen Sie eine Stichprobe einer plötzlichen Regression, vergleichen Sie sie mit einer aktuellen Baseline und dokumentieren Sie den Diagnosegrund und die verantwortliche Code-Änderung.
  3. Beheben Sie versehentliche Drift bei Präfix oder Konfiguration; behalten Sie beabsichtigte Änderungen bei Qualität oder Routing bei, wenn sich die Gesamtwirtschaftlichkeit der Aufgabe verbessert.
  4. Validieren Sie das Ergebnis mit repräsentativem Produktions-Traffic und gleichen Sie die beobachteten Einsparungen mit der Abrechnung ab.

Die Diagnostics selbst verursachen keine zusätzliche Funktionsgebühr, aber zusätzliche Testanfragen werden normal abgerechnet. Der Gewinn ist nicht ein schöneres Trefferquoten-Diagramm. Es ist eine belastbare Erklärung dafür, warum sich die Input-Kosten eines bestimmten Workloads verändert haben, und ob die vorgeschlagene Korrektur die Rechnung tatsächlich gesenkt hat.

Fragen, die Teams stellen

Beweist eine Cache-Hit-Diagnose, dass eine Anfrage günstiger war?

Nein. Sie besagt, dass gegenüber der gewählten Baseline kein Miss erkannt wurde. Prüfen Sie die tatsächlichen cached_tokens und die bepreisten Token-Kategorien der Anfrage, bevor Sie Einsparungen behaupten.

Können Diagnostics zwei beliebige OpenAI-Anfragen vergleichen?

Nein. Verwenden Sie eine aktuelle, abgeschlossene Baseline derselben Organisation und erwarten Sie diesen Ablauf nur bei unterstützten Responses-API-Modellen ab GPT-5.6. Ein Vergleichsdatensatz kann ablaufen.

Sollte jeder Cache-Miss beseitigt werden?

Nein. Ein Modellwechsel, ein anderer Service-Tier oder komprimierter Kontext können beabsichtigt sein. Vergleichen Sie Qualität, Latenz und Kosten pro erfolgreicher Aufgabe, bevor Sie die Änderung rückgängig machen.

Weiterführend


Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →

Zurück zu finopsllm.com