Langsung ke konten

Hasil tes Jev independen tentang biaya

Diperbarui September 21, 2026 · pertama terbit September 21, 2026

Jawaban singkat: Pengujian independen awal mendukung cerita dasar Jev: ini cara yang cepat dan murah untuk membuat keputusan bertipe. Ada juga kualifikasi yang diperlukan: penghematannya bergantung pada apa yang...

Pengujian independen awal mendukung cerita dasar Jev: ini cara yang cepat dan murah untuk membuat keputusan bertipe. Ada juga kualifikasi yang diperlukan: penghematannya bergantung pada apa yang digantikannya. Membandingkan Jev dengan panggilan penalaran yang lambat menghasilkan hasil yang dramatis. Membandingkannya dengan model kecil berkeluaran terstruktur menghasilkan selisih yang lebih kecil, tetapi tetap berguna.

Tes yang dapat direproduksi dan paling rinci yang kami temukan adalah jev-measured, yang memanggil Jev melalui OpenRouter di delapan kasus termasuk routing, pemilihan tool, moderasi, reranking, penilaian lead, dan guardrail. Biaya keputusan yang dilaporkan berada di antara $0.0000153 dan $0.0000254. Dalam uji head-to-head-nya, latensi median Jev adalah 352 ms dan biaya rata-ratanya $0.0000188.

Di mana penghematannya nyata

Terhadap GPT-5 Nano dalam tes itu, Jev berbiaya sekitar 18 kali lebih murah per fixture dan merespons jauh lebih cepat. Itu bermakna ketika alur kerja lama meminta model generatif membaca state, bernalar, menghasilkan respons berformat, lalu kode menarik satu keputusan dari teks tersebut.

Terhadap Gemini Flash Lite dan Mistral Small, selisih biaya terukur hanya 1.7 kali dan 1.4 kali. Pada satu kasus pertanyaan tunggal, model kecil justru lebih murah. Itu bukan kegagalan Jev. Itu mendefinisikan peluang sebenarnya: Jev paling kuat ketika satu panggilan dapat menggantikan langkah keputusan yang berulang, atau ketika beberapa pertanyaan keputusan dapat dievaluasi bersama, bukan ketika ia dipaksakan ke setiap klasifikasi sepele.

Keluaran bertipe menghilangkan biaya nyata

Benchmark yang sama awalnya menemukan kesalahan skema pada baseline model chat: boolean di tempat probabilitas diminta, string probabilitas alih-alih angka, dan field yang hilang. Mode skema JSON yang ketat menghilangkan kesalahan tersebut. Koreksi ini penting. Tulisan FinOps yang baik tidak menyembunyikan konfigurasi terbaik baseline. Namun, ini menunjukkan bahwa validasi keluaran, perbaikan, percobaan ulang, dan parsing adalah biaya tersendiri, dan Jev menghilangkan seluruh kategori itu untuk kontrak keluarannya sendiri.

Akurasi dan kalibrasi tetap menentukan rollout

Biaya dan latensi tidak menjawab apakah sebuah keputusan cukup baik untuk diotomatisasi. Sebuah tes independen physical-AI melaporkan kesepakatan 91.3% dengan 300 template insiden miliknya sendiri, sementara tes kecil pada tiket dukungan tidak menemukan bukti yang mendukung klaim menyeluruh bahwa Jev lebih akurat daripada semua model chat. Keduanya adalah eksperimen awal yang sempit. Keduanya menunjuk ke tes produksi yang tepat: evaluasi Jev pada kasus berlabel Anda sendiri dan periksa akurasi di setiap tingkat keyakinan.

Scorecard praktis memiliki lima baris: akurasi keputusan, kalibrasi keyakinan, latensi median dan P95, biaya per keputusan benar, dan tingkat eskalasi. Itu menghasilkan hasil yang dapat ditindaklanjuti: arahkan kasus-kasus ini ke Jev di atas ambang ini, dan kirim sisanya ke model yang lebih besar atau ke peninjauan. Ini lebih berguna daripada hype peluncuran atau peringatan umum untuk tidak mempercayai model.

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com