Langsung ke konten

98% token input Codex kami ter-cache. Tanpa cache, tagihannya 12x lebih besar

Diperbarui October 9, 2026 · pertama terbit October 9, 2026

Jawaban singkat: Dalam 12 hari penggunaan Codex yang intensif dengan ChatGPT Pro $100, kami mengirim 13.0 miliar token input dan menerima kembali 47 juta token output. 97.6% dari input tersebut adalah cache hit....

Dalam 12 hari penggunaan Codex yang intensif dengan ChatGPT Pro $100, kami mengirim 13.0 miliar token input dan menerima kembali 47 juta token output. 97.6% dari input tersebut adalah cache hit. Dengan harga API OpenAI, pekerjaan ini setara $1,211. Jika token yang sama dihitung tanpa cache hit sama sekali, nilainya menjadi $14,198, 12 kali lipat.

Nilai API 12 hari Codex per model: ter-cache vs tanpa cache$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraOranye: yang kami bayar dalam nilai API, dengan cachingBiru: token yang sama tanpa cache hit
Nilai API 12 hari Codex per model: ter-cache vs tanpa cache

Mengapa agen coding hampir seluruhnya berupa input ter-cache

Loop agen mengirim ulang seluruh percakapan di setiap langkah: system prompt, definisi tool, file yang sudah dibaca, dan setiap hasil tool sebelumnya. Setiap langkah menambah sedikit lalu membaca ulang semuanya. Jadi input tumbuh seiring kuadrat panjang sesi, sementara output tetap kecil. Selama 12 hari, itu menghasilkan rasio input terhadap output 279:1.

Prompt caching yang membuat semua ini tetap terjangkau. Input ter-cache di API OpenAI biayanya sepersepuluh atau kurang dari input biasa. GPT-6 Sol, yang mengerjakan sebagian besar pekerjaan kami, mengenakan $2 per juta token input dan $0.10 per juta token ter-cache.

Ke mana uangnya pergi

ModelToken inputTer-cacheToken outputNilai APITanpa cache
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Total13.01B97.6%47M$1,211$14,198
Komponen biayaNilai APIPorsi
Input ter-cache$72860%
Input tidak ter-cache$28824%
Output$19616%

Bahkan dengan diskon 95%, input ter-cache tetap menjadi komponen terbesar. Itulah ciri beban kerja agen: jenis token termurah, dalam volume yang sangat besar. Total per model ada di codex-pro-100-model-mix.csv.

Apa yang merusak cache

Cache hit membutuhkan prefiks yang identik. Setiap perubahan di awal konteks memaksa semua yang ada setelahnya dibaca ulang dengan harga penuh.

Mengapa ini penting untuk batas Codex Anda

Jika pengukur Codex memberi bobot pada input ter-cache mendekati harga API-nya, penurunan 1 poin pada cache hit rate itu mahal. Dengan volume kami, jika Sol turun dari 98.1% menjadi 90% ter-cache, tambahannya sekitar $1,004 hanya untuk input Sol, kira-kira 6 jendela Pro $100 tambahan. Disiplin cache adalah disiplin kuota. Untuk melihat isi satu jendela, lihat pengukuran multiplier Pro $100 kami; untuk melihat cara kami mendapatkan delapan jendela dalam 12 hari, lihat log reset.

Cara kami mengukur

Codex menulis log JSONL untuk setiap sesi di ~/.codex/sessions/. Setiap request mencatat input kumulatif, input ter-cache, dan output, plus pengukur mingguan (used_percent) dan waktu resets_at. Kami menghitung delta token setiap request dengan harga list API model yang menjalankannya, lalu mengelompokkan request per jendela mingguan. Angka dolar adalah nilai setara API, bukan uang yang benar-benar kami bayar.

Sumber

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com