Langsung ke konten

Ox Alpha adalah GLM-5.3

Diperbarui September 1, 2026 · pertama terbit September 1, 2026

Jawaban singkat: Antara 20 dan 26 Agustus 2026, model yang tercantum di OpenRouter sebagai stealth/ox-alpha dilayani tanpa biaya. Model ini kemudian teridentifikasi sebagai GLM-5.3-Flash: 320 miliar parameter total...

Antara 20 dan 26 Agustus 2026, model yang tercantum di OpenRouter sebagai stealth/ox-alpha dilayani tanpa biaya. Model ini kemudian teridentifikasi sebagai GLM-5.3-Flash: 320 miliar parameter total dengan 18 miliar aktif, atensi hibrida linear dan sparse, input native teks, gambar, dan video, jendela konteks 1.048.576 token, output maksimum 131K, serta bobot berlisensi MIT.

Adopsinya bukan kecil. Dalam tiga hari sejak model itu muncul, OpenCode melaporkan sekitar 16 triliun token yang diproses, 221.000 pengguna unik, lebih dari lima juta sesi, dan posisi kedua berdasarkan penggunaan terbaru. Itu trafik produksi, bukan trafik evaluasi, dan selama enam hari biayanya nol.

Gratis adalah sebuah tarif, bukan ketiadaan

Masalah finansial dari endpoint stealth yang gratis adalah bahwa sebagian besar telemetri biaya memperlakukan baris $0 seolah tidak ada. Permintaan yang dirutekan ke Ox Alpha selama minggu itu muncul di dashboard penggunaan sebagai biaya nol, sehingga tidak ikut dihitung dalam prakiraan belanja, alert anggaran, atau tampilan unit economics per fitur. Lalu jendelanya tutup, model diganti namanya, tarif diterapkan, dan trafik yang sama muncul kembali sebagai lonjakan yang tidak pernah dimodelkan.

Solusinya adalah menghitung setiap panggilan dengan harga bayangan, termasuk yang gratis. Catat jumlah token seperti biasa lalu kalikan dengan harga list model yang seharusnya Anda pakai. Dashboard Anda kemudian menunjukkan nilai promosi per bulan dan berapa tagihan pada hari promosi berakhir. Enam belas triliun token pada tarif flash-tier yang umum bukanlah angka pembulatan.

Tarifnya sudah tidak hipotetis. GLM-5.3-Flash kini dibanderol $0,15 per juta token input dan $0,50 per juta token output. Enam belas triliun token input dengan tarif itu kira-kira $2,4 juta. Itulah nilai enam hari token gratis, dan besarnya lonjakan jika trafik tersebut tetap di sana.

Tiga risiko yang perlu dicek

RisikoPertanyaan yang perlu diajukanKontrol
Tebing tarifBerapa biaya trafik ini besok pada harga list?Harga bayangan untuk endpoint gratis, dengan alert anggaran yang sama.
Pergeseran identitasModel mana yang ada di balik alias minggu ini?Kunci ID model; jangan pernah merutekan produksi ke alias stealth tanpa fallback.
Keterikatan kualitasApakah prompt sudah disetel untuk model yang tidak bisa Anda pertahankan?Jalankan evals terhadap pengganti yang disebutkan namanya sebelum jendela berakhir.

Bobot MIT mengubah hitungan beli versus bangun

Pengungkapan identitas ini penting untuk alasan kedua. GLM-5.3-Flash dirilis dengan lisensi MIT, sehingga opsi self-hosting itu nyata, bukan sekadar teori. Dengan 18 miliar parameter aktif dari total 320 miliar, biaya serving lebih dekat ke model dense menengah daripada angka utama yang tertera. Namun ini hanya berlaku jika utilisasi Anda tinggi dan konsisten. Di bawah sekitar 40–50% utilisasi GPU, harga API per token biasanya masih menang, karena akselerator yang menganggur tetap ditagih penuh sementara panggilan API yang tidak terjadi tidak ditagih sama sekali.

Jadi keputusannya bukan open-weights versus API. Ini soal ambang utilisasi. Ukur token per detik yang berkelanjutan selama seminggu penuh, termasuk malam dan akhir pekan, lalu baru bandingkan penawaran kapasitas terpesan dengan volume yang sama pada tarif list API. Masukkan juga waktu engineering untuk serving, evaluasi, dan upgrade ke kolom self-hosted. Itulah baris yang paling sering terlupa dalam studi kelayakan membangun sendiri.

Apa yang harus dilakukan saat model stealth berikutnya muncul

Perlakukan setiap jendela gratis sebagai kontrak berjangka dengan pihak lawan yang tidak disebutkan namanya. Evaluasi modelnya dengan benar, karena token gratis memang cara murah untuk menjalankan rangkaian eval. Tetapi kirim trafik produksi ke sana hanya di belakang fallback, pertahankan harga bayangan di dashboard, dan catat akhir jendela sebagai peristiwa yang harus diprakirakan. Modelnya bagus dan harganya nol. Hanya satu dari dua fakta itu yang bertahan.

Bacaan terkait

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com