Claude Haiku 5.5 dan ambang harga 100k token
Diperbarui October 8, 2026 · pertama terbit October 8, 2026
Harga Claude Haiku 5.5 bergantung pada panjang prompt. Anthropic merilis model ini pada 7 Oktober 2026 untuk pekerjaan volume tinggi seperti klasifikasi, ringkasan, dan tugas subagen. Jendela konteks 1 juta token-nya tidak berarti semua token itu dihargai dengan tarif prompt pendek: prompt di atas 100.000 token memakai tingkat harga yang lebih tinggi. Karena itu, ukuran permintaan menjadi keputusan anggaran, terutama untuk agen yang mengumpulkan dokumen dan hasil alat.
Kartu tarif punya dua sisi
Berikut adalah harga standar Claude API yang dipublikasikan Anthropic dalam dolar AS per juta token, dicek pada 8 Oktober. Batasnya adalah prompt hingga 100.000 token dibanding di atas 100.000; ini bukan harga yang hanya dikenakan pada token di atas ambang. Periksa dokumentasi harga terbaru sebelum memakai angka ini dalam proyeksi.
| Kategori token | Prompt hingga 100k | Prompt di atas 100k |
|---|---|---|
| Input tanpa cache | $0.10 | $0.50 |
| Output | $0.50 | $2.50 |
| Penulisan cache 5 menit | $0.125 | $0.625 |
| Penulisan cache 1 jam | $0.20 | $1.00 |
| Pembacaan cache | $0.01 | $0.05 |
Setiap tarif token yang tercantum menjadi lima kali lebih tinggi di atas ambang. Itu tidak berarti setiap tagihan aplikasi naik lima kali lipat: sebagian besar panggilan mungkin tetap pendek, dan volume output, caching, alat, pemrosesan batch, percobaan ulang, serta keberhasilan tugas semuanya memengaruhi total biaya. Konteks yang di-cache tetap memakan ruang prompt; cache hit tidak mengubah permintaan 120k token menjadi prompt pendek.
Seperti apa ambang itu pada satu permintaan
Pertimbangkan dua panggilan ilustratif tanpa caching dan tanpa alat yang ditagih terpisah, masing-masing menghasilkan 1.000 token output. Prompt 99.000 token berbiaya sekitar $0.0104 untuk input plus output dengan tarif prompt pendek. Prompt 101.000 token berbiaya sekitar $0.0530 dengan tarif prompt panjang. Itu kira-kira lima kali lipat untuk permintaan yang hanya 2.000 token input lebih panjang. Contoh ini menjaga output tetap agar hanya menyoroti batas harga; ini bukan penghematan produksi yang terukur. Prompt nyata juga mencakup instruksi sistem, riwayat percakapan, skema alat, dan hasil alat.
Hitung ulang sebelum migrasi
Catatan migrasi Anthropic menyebutkan bahwa teks yang sama menghasilkan sekitar 30% lebih banyak token di Haiku 5.5 dibanding Haiku 4.5, dengan variasi tergantung konten. Prompt yang tampak jauh di bawah 100k dengan hitungan token lama bisa melewati ambang baru. Jangan mengalikan semua hitungan lama dengan 1.3 lalu menganggapnya sebagai proyeksi tagihan; hitung ulang permintaan yang representatif dengan claude-haiku-5-5.
Endpoint penghitungan token Anthropic menerima pesan terstruktur, prompt sistem, dan alat klien yang didukung sebelum permintaan generasi dikirim. Hitung dengan model target, lalu catat penggunaan aktual setelah respons. Penghitungan awal adalah estimasi dan bisa sedikit berbeda dari input yang ditagih; beberapa alat server serta blok URL atau file tidak didukung oleh penghitung. Untuk jalur tersebut, andalkan penggunaan permintaan yang teramati dan sisakan margin aman di dekat ambang.
Aturan anggaran prompt untuk subagen
- Ukur distribusinya. Catat jumlah token prompt Haiku 5.5 menurut beban kerja, ID model, dan hasil tugas. Perhatikan berapa banyak panggilan yang berkumpul di dekat atau di atas 100k, bukan hanya rata-ratanya.
- Beri peringatan sebelum ambang. Tandai permintaan yang mendekati ambang di orkestrator agen. Perlakukan tingkat peringatan sebagai margin operasional Anda sendiri, bukan aturan harga Anthropic.
- Pangkas penyebabnya. Hapus potongan retrieval yang duplikat, batasi ukuran hasil alat, atau padatkan riwayat usang bila tes kualitas memungkinkan. Jangan membuang bukti yang dibutuhkan agen hanya untuk menghemat token.
- Bandingkan ekor panjangnya. Untuk prompt panjang yang tak terhindarkan, uji Haiku di tingkat harga yang lebih tinggi terhadap rute lain pada tugas yang sama. Bandingkan biaya per hasil yang diterima, latensi, dan frekuensi fallback, bukan hanya harga daftar.
- Cocokkan dengan faktur. Hitung input, output, serta pembacaan dan penulisan cache aktual pada tingkat yang berlaku, lalu tambahkan alat dan percobaan ulang. Periksa lagi tarif penyedia atau platform cloud dan diskon kontrak apa pun.
Haiku 5.5 mungkin tetap pilihan terbaik di atas 100k, tetapi itu harus menjadi keputusan routing yang terukur. Kontrol yang penting adalah mengetahui permintaan mana yang melewati batas dan mengapa.
Pertanyaan yang sering diajukan tim
Apakah harga lebih tinggi hanya berlaku untuk token di atas 100k?
Tidak. Anthropic menjelaskan Haiku 5.5 dihargai menurut panjang prompt: prompt di atas 100.000 token membayar tarif publikasi yang lebih tinggi untuk permintaan tersebut.
Bisakah prompt caching membuat permintaan panjang tetap di tingkat yang lebih murah?
Tidak. Token yang digunakan ulang bisa mendapat tarif pembacaan cache, tetapi konteks yang di-cache tetap memakan panjang prompt. Hitung seluruh prompt saat memeriksa ambang.
Apakah kenaikan token 30% dari tokenizer dijamin?
Tidak. Anthropic menyebut sekitar 30% lebih banyak token untuk teks yang sama dibanding Haiku 4.5, tergantung konten. Hitung prompt Anda sendiri pada model target.
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →