Menghitung harga model open-weight
Diperbarui September 1, 2026 · pertama terbit September 1, 2026
Qwen3.8-Flash-Next hadir pada 26 Agustus 2026 sebagai pratinjau open-weight dari arsitektur Qwen4: sekitar 6B parameter aktif, konteks asli 262.144 token, dan belum ada harga hosted yang diumumkan. Kombinasi ini merusak perbandingan biasa. Setiap model tertutup memberi Anda angka per juta token; rilis open-weight memberi Anda checkpoint dan menyerahkan angkanya kepada Anda.
Angkanya tidak sulit dihitung. Hanya saja, kebanyakan tim tidak pernah menghitungnya, dan malah membandingkan unduhan $0 dengan API $3,00/MTok lalu menyimpulkan unduhan itu lebih murah. Bisa jadi memang begitu. Hitungan yang menentukan, dan hitungan itu punya satu suku yang sering dilupakan.
Rumusnya
Biaya per juta token adalah harga per jam instance dibagi jumlah token yang dihasilkan instance itu dalam satu jam:
cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000Dengan $2,00 per jam dan 1.500 token per detik yang diukur, hasilnya 2.00 / 5.400.000 * 1.000.000 = $0,37 per juta token. Dibandingkan model hosted seharga $3,00/MTok output, self-hosting tampak hemat delapan kali lipat. Angka itu juga keliru, karena mengasumsikan GPU sibuk setiap detik yang Anda bayar.
Suku yang sering dilupakan: utilisasi
Anda menyewa satu jam penuh; Anda hanya memakai sebagian. Bagi dengan bagian itu:
| Utilisasi | Biaya efektif per MTok |
|---|---|
| 100% | $0,37 |
| 60% | $0,62 |
| 30% | $1,23 |
| 10% | $3,70 |
Pada utilisasi 10%, model self-hosted justru lebih mahal daripada API hosted yang seharusnya digantikannya. Sebagian besar deployment pertama berada di antara 10% dan 30%, karena trafiknya bursty dan instance disiapkan untuk puncak. Penghematannya nyata, tetapi itu penghematan pada utilisasi, bukan pada bobot model.
Apa lagi yang masuk ke angka
Penyimpanan dan egress untuk checkpoint. Waktu menganggur antara instance menyala dan model siap, karena pada model konteks besar proses pemuatan bisa memakan menit, dan Anda membayar semuanya. Redundansi, jika beban kerja memerlukan lebih dari satu instance agar tetap hidup saat satu node gagal. Dan waktu engineering, yang tidak ditagihkan per jam tetapi merupakan pos terbesar pada tahun pertama.
Tidak satu pun dari itu membatalkan self-hosting. Yang dibantahnya adalah membandingkan unduhan gratis dengan tarif per token tanpa melakukan pembagian.
Ukur sebelum berkomitmen
Jalankan model pada instance yang benar-benar akan Anda sewa, dengan bentuk prompt dan panjang konteks Anda sendiri, lalu catat token per detik di bawah konkurensi — bukan angka single-stream dari model card. Setelah itu, ambil profil trafik per jam yang nyata dan hitung utilisasinya. Dua angka, satu pembagian, dan keputusannya terbentuk sendiri.
Konteks panjang adalah tempat hal ini paling terasa. Konteks 262K token adalah footprint memori sebelum menjadi fitur: ia menentukan kelas instance, dan kelas instance menentukan harga per jam di bagian atas rumus. Hitung konteks yang benar-benar Anda kirim, bukan konteks yang didukung model.
Terkait
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →