Cache miss di balik tagihan OpenAI Anda
Diperbarui September 26, 2026 · pertama terbit September 26, 2026
Dasbor cache prompt bisa memberi tahu Anda bahwa penggunaan ulang menurun. Namun, dasbor itu sendiri tidak bisa menjelaskan perubahan permintaan mana yang menyebabkan penurunan tersebut atau berapa biayanya. Rilis 8 September 2026 dari OpenAI menjadikan Prompt Cache Diagnostics tersedia umum di Responses API untuk GPT-5.6 dan model yang didukung setelahnya. Langkah FinOps yang berguna adalah mengubah penurunan token ter-cache menjadi investigasi singkat yang bisa diulang.
Bandingkan permintaan yang meleset
Simpan ID respons yang baru dan sudah selesai, yang prefiksnya Anda harapkan dapat digunakan ulang. Pada permintaan Responses API berikutnya yang sebanding dari organisasi yang sama, atur prompt_cache_options.comparison_response_id ke ID tersebut. Lalu baca prompt_cache_diagnostics pada respons baru, bersama usage.input_tokens_details.cached_tokens. Opsi perbandingan hanya meminta diagnosis; opsi ini tidak memuat percakapan sebelumnya dan tidak mengubah perilaku cache. Panduan diagnostics dari OpenAI menyertakan contoh permintaan yang bisa langsung dijalankan.
const next = await client.responses.create({
model: model,
instructions: stableInstructions,
input: nextInput,
tools: stableTools,
prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);Cuplikan ini mengasumsikan baseline adalah respons yang baru dan sudah selesai, sedangkan variabel lainnya adalah data permintaan Anda sendiri. Jaga prefiks yang stabil cukup panjang agar bisa di-cache: OpenAI mendokumentasikan minimum 1,024 token untuk GPT-5.6 dan yang setelahnya. Prompt yang kecil atau sangat berbeda tidak menjadi uji cache miss yang bermakna.
Perbaiki penyebabnya, bukan metriknya
Hasil cache_miss bisa menunjuk pada perubahan model, service tier, definisi atau urutan tool, cache key, format respons, reasoning effort, verbosity, atau konteks yang dipadatkan. Misalnya, mengganti nama skema tool yang tampak tidak berbahaya bisa membatalkan prefiks yang dapat digunakan ulang. Bandingkan konfigurasi permintaan dan byte awal prompt, kembalikan kestabilan di titik perubahan yang tidak disengaja, lalu jalankan ulang perbandingan terhadap baseline yang sama. OpenAI melaporkan penyebab pertama yang ditemukan, sehingga penyebab lain bisa muncul setelah perbaikan pertama.
Jangan memaksa cache hit jika perubahannya memang disengaja. Model lain bisa menurunkan total biaya tugas meskipun kehilangan penggunaan ulang cache; pemadatan juga bisa mengurangi konteks di masa depan. Nilai seluruh permintaan dan tugas, bukan persentase cache hit secara terpisah. Baseline yang sudah kedaluwarsa atau hasil unavailable tidak meyakinkan, dan bukan bukti bahwa cache gagal.
Terjemahkan temuan menjadi uang
cache_missed_tokens memperkirakan token yang dapat digunakan ulang dan hilang dibanding respons pembanding. Ini bukan jumlah token yang ditagih. Hasil cache_hit juga tidak memastikan penghematan dalam dolar. Untuk biaya input yang sebenarnya, kumpulkan total input_tokens, cached_tokens, dan cache_write_tokens dari setiap respons, lalu terapkan tarif terkini untuk model dan tingkat pemrosesan tersebut. Untuk GPT-5.6 dan yang setelahnya, panduan prompt caching dari OpenAI menyatakan bahwa pembacaan cache dikenai 0.1 kali tarif input tanpa cache dan penulisan cache dikenai 1.25 kali tarif tersebut.
ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000Ini adalah kategori token yang saling terpisah: jangan menambahkan biaya tambahan penulisan cache pada token yang sudah dihitung dengan tarif penulisan. Rumus ini hanya mencakup input; sertakan output, tool, percobaan ulang, dan biaya lain saat menghitung biaya per tugas yang berhasil. Gunakan tabel harga terkini dari penyedia, bukan harga tetap dari artikel ini.
Pemeriksaan mingguan yang berguna
- Kelompokkan lalu lintas yang sebanding menurut beban kerja, model, dan service tier; buat grafik proporsi token ter-cache dan biaya input per tugas yang selesai.
- Ambil sampel regresi mendadak, bandingkan dengan baseline terbaru, lalu catat alasan diagnosis dan perubahan kode yang bertanggung jawab.
- Perbaiki penyimpangan prefiks atau konfigurasi yang tidak disengaja; pertahankan perubahan kualitas atau routing yang disengaja jika ekonomi tugas secara keseluruhan membaik.
- Validasi hasilnya dengan lalu lintas produksi yang representatif, dan cocokkan penghematan yang teramati dengan tagihan.
Diagnostics sendiri tidak dikenai biaya fitur tambahan, tetapi permintaan uji tambahan tetap ditagih seperti biasa. Manfaatnya bukan grafik tingkat hit yang lebih rapi. Manfaatnya adalah penjelasan yang dapat dipertanggungjawabkan tentang mengapa biaya input beban kerja tertentu berubah, dan apakah perbaikan yang diusulkan benar-benar menurunkan tagihannya.
Pertanyaan yang sering diajukan tim
Apakah diagnosis cache hit membuktikan permintaan itu lebih murah?
Tidak. Diagnosis ini hanya menyatakan bahwa tidak ada miss yang terdeteksi terhadap baseline yang dipilih. Periksa cached_tokens yang sebenarnya dan kategori token berbayar pada permintaan sebelum mengklaim penghematan.
Apakah diagnostics bisa membandingkan dua permintaan OpenAI mana pun?
Tidak. Gunakan baseline yang baru dan sudah selesai dari organisasi yang sama, dan harapkan alur ini hanya pada model Responses API GPT-5.6 atau yang lebih baru yang didukung. Catatan perbandingan bisa kedaluwarsa.
Apakah setiap cache miss harus dihilangkan?
Tidak. Pergantian model, service tier yang berbeda, atau konteks yang dipadatkan bisa jadi disengaja. Bandingkan kualitas, latensi, dan biaya per tugas yang berhasil sebelum membatalkan perubahan tersebut.
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →