98% token input Codex kami ter-cache. Tanpa cache, tagihannya 12x lebih besar
Diperbarui October 9, 2026 · pertama terbit October 9, 2026
Dalam 12 hari penggunaan Codex yang intensif dengan ChatGPT Pro $100, kami mengirim 13.0 miliar token input dan menerima kembali 47 juta token output. 97.6% dari input tersebut adalah cache hit. Dengan harga API OpenAI, pekerjaan ini setara $1,211. Jika token yang sama dihitung tanpa cache hit sama sekali, nilainya menjadi $14,198, 12 kali lipat.
- Rasio input terhadap output: sekitar 279 token input untuk setiap token output.
- Porsi input ter-cache dalam tagihan: 60%, meski dengan diskon 95%.
- Porsi output dalam tagihan: 16%.
Mengapa agen coding hampir seluruhnya berupa input ter-cache
Loop agen mengirim ulang seluruh percakapan di setiap langkah: system prompt, definisi tool, file yang sudah dibaca, dan setiap hasil tool sebelumnya. Setiap langkah menambah sedikit lalu membaca ulang semuanya. Jadi input tumbuh seiring kuadrat panjang sesi, sementara output tetap kecil. Selama 12 hari, itu menghasilkan rasio input terhadap output 279:1.
Prompt caching yang membuat semua ini tetap terjangkau. Input ter-cache di API OpenAI biayanya sepersepuluh atau kurang dari input biasa. GPT-6 Sol, yang mengerjakan sebagian besar pekerjaan kami, mengenakan $2 per juta token input dan $0.10 per juta token ter-cache.
Ke mana uangnya pergi
| Model | Token input | Ter-cache | Token output | Nilai API | Tanpa cache |
|---|---|---|---|---|---|
| Sol | 6.56B | 98.1% | 17.5M | $1,073 | $13,299 |
| Luna | 6.41B | 97.2% | 29.0M | $95 | $655 |
| GPT-5.5 | 0.03B | 93.5% | 0.2M | $27 | $144 |
| Astra | 0.01B | 94.5% | 0.0M | $16 | $99 |
| Total | 13.01B | 97.6% | 47M | $1,211 | $14,198 |
| Komponen biaya | Nilai API | Porsi |
|---|---|---|
| Input ter-cache | $728 | 60% |
| Input tidak ter-cache | $288 | 24% |
| Output | $196 | 16% |
Bahkan dengan diskon 95%, input ter-cache tetap menjadi komponen terbesar. Itulah ciri beban kerja agen: jenis token termurah, dalam volume yang sangat besar. Total per model ada di codex-pro-100-model-mix.csv.
Apa yang merusak cache
Cache hit membutuhkan prefiks yang identik. Setiap perubahan di awal konteks memaksa semua yang ada setelahnya dibaca ulang dengan harga penuh.
- Berganti model di tengah sesi. Model baru tidak punya cache untuk konteks Anda.
- Mengubah instruksi atau daftar tool di tengah sesi. Keduanya berada di bagian atas prompt, sehingga semua yang ada di bawahnya ikut dibaca ulang.
- Jeda panjang. Cache kedaluwarsa. Kembali setelah jeda berarti membaca ulang sesi dengan harga penuh.
- Compaction. Merangkum riwayat menulis ulang prefiks. Ini menghemat token nanti, tetapi membebankan satu pass tanpa cache sekarang.
Mengapa ini penting untuk batas Codex Anda
Jika pengukur Codex memberi bobot pada input ter-cache mendekati harga API-nya, penurunan 1 poin pada cache hit rate itu mahal. Dengan volume kami, jika Sol turun dari 98.1% menjadi 90% ter-cache, tambahannya sekitar $1,004 hanya untuk input Sol, kira-kira 6 jendela Pro $100 tambahan. Disiplin cache adalah disiplin kuota. Untuk melihat isi satu jendela, lihat pengukuran multiplier Pro $100 kami; untuk melihat cara kami mendapatkan delapan jendela dalam 12 hari, lihat log reset.
Cara kami mengukur
Codex menulis log JSONL untuk setiap sesi di ~/.codex/sessions/. Setiap request mencatat input kumulatif, input ter-cache, dan output, plus pengukur mingguan (used_percent) dan waktu resets_at. Kami menghitung delta token setiap request dengan harga list API model yang menjalankannya, lalu mengelompokkan request per jendela mingguan. Angka dolar adalah nilai setara API, bukan uang yang benar-benar kami bayar.
Sumber
Terkait
- ChatGPT Pro $100 sebenarnya setara 2.6x Plus
- 8 jendela mingguan Codex dalam 12 hari
- Reset Codex mengubah $40 menjadi $1,211
- Apa saja yang termasuk di Codex ChatGPT Pro
- Claude Max 20x vs ChatGPT Pro
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →