Model biaya Claude Fable 5.1
Diperbarui September 1, 2026 · pertama terbit September 1, 2026
Claude Fable 5.1 (claude-fable-5-1) dihargai $10 per juta token input dan $50 per juta token output. Opus 5 berharga $5 dan $25. Jika hanya membaca keempat angka itu, Fable tampak sebagai premi tetap 2×. Modelnya keliru. Tarif input ber-cache bergerak ke arah sebaliknya, dan untuk beban produksi, cache biasanya menampung sebagian besar token.
Empat tarif yang penting
Sebuah model tidak punya satu harga. Fable 5.1 menagih lima jenis token berbeda, dan hanya dua yang ada di angka utama.
| Jenis token | Fable 5.1 | Opus 5 |
|---|---|---|
| Input (tanpa cache) | $10.00 / MTok | $5.00 / MTok |
| Output | $50.00 / MTok | $25.00 / MTok |
| Penulisan cache (5 menit) | $12.50 / MTok | $6.25 / MTok |
| Penulisan cache (1 jam) | $20.00 / MTok | $10.00 / MTok |
| Pembacaan cache | $0.25 / MTok | $0.50 / MTok |
Pembacaan cache adalah pengecualian. Nilainya 2,5% dari harga input daftar Fable sendiri, dan setengah dari harga token ter-cache yang sama di Opus 5. Setiap baris lain 2×; baris itu saja 0,5×.
Dampaknya pada beban kerja nyata
Ambil agen dengan system prompt, skema tool, dan konteks hasil pengambilan 100.000 token yang dipakai ulang sepanjang sesi. Pada panggilan dingin, prefiks itu berharga $1.00 di Fable dan $0.50 di Opus 5. Pada panggilan hangat, harganya $0.025 di Fable dan $0.05 di Opus 5. Penyedia yang tadinya dua kali lebih mahal kini separuh harganya, untuk prompt yang sama, karena satu-satunya yang berubah adalah apakah prefiks mengenai cache.
Jadi titik impas adalah rasio hit cache, bukan preferensi model. Di bawah kira-kira 50% token input yang dilayani dari cache, premi input Fable mendominasi dan Opus 5 lebih murah untuk prefiks. Di atas itu, tarif cache Fable justru unggul dan terus unggul. Token output tetap 2× dalam kedua kasus, itulah sebabnya tuas kedua adalah panjang output, bukan pilihan model.
Output adalah sisi yang tidak dibatasi
Fable 5.1 menerima jendela konteks 1 juta token dan dapat menghasilkan hingga 128 ribu token output dalam satu respons. Dengan $50 per juta, satu respons 128K berharga $6.40 untuk output. Extended thinking selalu aktif untuk model ini; tidak ada cara mematikannya, dan kontrol budget_tokens yang lama ditolak dengan 400. Sebagai gantinya, tersedia pengaturan effort dari low sampai max. Itu sekarang menjadi pengatur biaya, dan sebaiknya masuk ke kebijakan perutean di samping pilihan model, bukan ke bawaan aplikasi yang tidak pernah ditinjau ulang.
Penalaran mentah tidak pernah dikembalikan, jadi telemetri Anda tidak bisa merekonstruksi biaya berpikir dari teks respons. Anda harus membacanya dari blok usage pada setiap panggilan lalu menyimpannya. Model ini juga tidak punya Priority Tier, sehingga latensi tidak bisa dibeli; perencanaan kapasitas harus dilakukan dengan konkurensi dan antrean di sisi Anda.
Yang harus diinstrumentasikan sebelum merutekan trafik
Tiga kolom menentukan apakah Fable 5.1 murah atau mahal bagi Anda, dan tidak satu pun muncul di daftar harga.
- Rasio hit cache per fitur. Bukan rata-rata tingkat akun; permukaan chat di 90% dan job batch di 0% saling meniadakan menjadi 45% yang tidak bermakna.
- Amplifikasi penulisan cache. Penulisan 1 jam berharga 2× input daftar. Prefiks yang ditulis ulang lebih sering daripada dibaca adalah kerugian bersih pada TTL berapa pun.
- Token output per tugas berhasil. Premi output 2× hanya layak jika lebih sedikit percobaan yang dibutuhkan. Ukur biaya per tugas berhasil, bukan biaya per panggilan.
Lalu jalankan perbandingan sebagai jembatan varians terhadap model Anda saat ini, memisahkan tarif, volume, dan mix. Model yang berharga daftar dua kali lipat tetapi harga cache separuhnya akan muncul sebagai dua pergerakan besar yang saling mengimbangi, dan rata-rata akan menyembunyikan keduanya.
Terkait
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →