Membayar jendela konteks dua kali
Diperbarui September 1, 2026 · pertama terbit September 1, 2026
Jendela konteks diiklankan sebagai kapasitas: 200.000 token, satu juta token, ruang untuk apa pun yang Anda butuhkan. Kapasitas bukan satuan penagihan. Anda ditagih untuk apa yang Anda kirim, dan dalam percakapan multi-giliran Anda mengirim hampir semuanya lagi di setiap giliran.
Itu pembayaran kedua. Dokumen 30.000 token yang dimuat di awal percakapan dua puluh giliran bukan 30.000 token input. Jumlahnya mendekati 600.000, karena giliran kedua mengirimnya ulang, begitu juga giliran kedua puluh.
Perhitungan yang tidak pernah dilakukan siapa pun
Biaya tumbuh sebanding dengan kuadrat panjang percakapan, bukan linear. Menggandakan jumlah giliran kira-kira melipatgandakan empat kali token input, dengan asumsi konteks terus menumpuk. Tim yang memodelkan "biaya per pesan" lalu mengalikannya dengan jumlah pesan sangat meremehkan sesi panjang, dan kesalahannya membesar justru pada pengguna yang paling ingin Anda pertahankan.
Sering ada biaya ketiga di atasnya: banyak penyedia menetapkan tarif premium untuk permintaan di atas ambang konteks panjang. Satu lampiran tambahan bisa mendorong permintaan melewati batas itu dan menaikkan harga seluruh panggilan, input dan output, bukan hanya token yang melewati batas.
Apa yang perlu diukur
Lacak utilisasi konteks: token yang dikirim dibandingkan token yang benar-benar dibutuhkan model. Ini metrik pemborosan terdekat yang dimiliki domain ini. Lacak token input per percakapan, bukan per permintaan, dan pantau p99 — di situlah sesi yang biayanya dua puluh kali median berada.
Beri peringatan untuk permintaan yang melewati ambang harga konteks panjang. Ini perubahan tangga, bukan gradien, dan tidak akan terlihat seperti apa pun di total harian.
Tiga perbaikan, dari yang termurah
Cache awalan yang stabil. Jika system prompt dan dokumen yang dimuat tidak berubah selama percakapan, prompt caching mengubah biaya berulang menjadi sebagian kecil darinya. Ini perubahan dengan imbal hasil tertinggi untuk produk multi-giliran mana pun.
Pangkas riwayat dengan sengaja. Giliran lama jarang layak dikirim ulang dengan harga penuh. Ringkas bagian awal percakapan panjang dan buang giliran mentahnya; alur percakapan tetap terjaga dan Anda berhenti membayar penuh untuknya.
Kirim kutipannya, bukan korpusnya. Retrieval ada justru untuk ini. Jendela yang cukup besar untuk menampung seluruh dokumen bukan alasan untuk memasukkan seluruh dokumen ke dalamnya.
Terkait
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →