System One Models dan optimasi biaya Jev
Diperbarui September 27, 2026 · pertama terbit September 27, 2026
Diumumkan pada September 2026, System One Models dan Jev membentuk lapisan perutean berbasis kalibrasi untuk agen LLM. Alih-alih merutekan berdasarkan jenis tugas atau aturan statis, Jev merutekan berdasarkan kalibrasi: model murah (System One) menjawab lebih dulu; jika tingkat keyakinannya di bawah ambang, permintaan dieskalasi ke model premium. Bagi FinOps, ini berarti Anda hanya membayar penalaran ketika model murah benar-benar tidak tahu.
Cara kerjanya
- System One Model (kecil, cepat, murah) menghasilkan jawaban dan skor keyakinan yang terkalibrasi.
- Gateway Jev memeriksa: apakah keyakinan >= ambang (misalnya, 0.9)?
- Jika ya: kembalikan jawaban System One. Biaya: ~$0.10/1M token.
- Jika tidak: eskalasi ke model premium (Astra, Opus 5.5, dll.). Biaya: $10-50/1M token.
Perbandingan biaya
| Strategi | Rata-rata biaya/tugas | Akurasi |
|---|---|---|
| Selalu Astra (effort maksimal) | $1.73 | 50.9 |
| Selalu Sol | $0.28 | 44.2 |
| Perutean statis (mudah→Sol, sulit→Astra) | $0.94 | 48.1 |
| Perutean kalibrasi Jev (ambang 0.9) | $0.41 | 49.8 |
Data dari benchmark Jev pada Artificial Analysis Intelligence Index. Perutean kalibrasi mencapai akurasi hampir setara Astra dengan 24% biaya.
Mengapa kalibrasi mengalahkan perutean statis
Perutean statis salah mengklasifikasikan 15–20% tugas (tugas mudah ditandai sulit, dan sebaliknya). Kalibrasi memperbaiki dirinya sendiri: model tahu kapan ia tidak tahu. Ambang Jev bisa diatur — naikkan untuk akurasi lebih tinggi, turunkan untuk biaya lebih rendah.
Implementasi FinOps
- Terapkan Jev sebagai gateway: semua trafik agen melewati Jev; System One adalah default.
- Atur ambang per alur kerja: chat yang dihadapi pelanggan = 0.95; batch latar belakang = 0.85.
- Lacak tingkat eskalasi: target 10–20% eskalasi. Lebih tinggi berarti System One kurang terlatih; lebih rendah berarti Anda membayar terlalu mahal.
- Anggarkan tingkat premium: batasi belanja eskalasi bulanan; beri peringatan di 80%.
Integrasi dengan agen yang sudah ada
Jev membungkus endpoint apa pun yang kompatibel dengan OpenAI. Agen yang ada memanggil Jev alih-alih memanggil model secara langsung. Tidak perlu perubahan kode pada logika agen — hanya base URL dan API key yang berubah.
Kesimpulan
Perutean berbasis kalibrasi adalah primitif FinOps pertama yang mengoptimalkan saat inferensi, bukan saat desain. System One + Jev mengubah pertanyaan ‘model mana?’ dari keputusan arsitektur statis menjadi kontrol biaya dinamis, per permintaan.
Terkait
- Kontrol dan anggaran agen Jev
- Ekonomi keputusan Jev untuk FinOps AI
- Model biaya GPT-6 Astra
- Pemotongan harga model dan anggaran perutean
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →