本文へ移動

System One ModelsとJevによるコスト最適化

更新日 September 27, 2026 · 初回公開 September 27, 2026

2026年9月に発表されたSystem One ModelsとJevは、LLMエージェント向けのキャリブレーションベースのルーティングレイヤーを構成します。タスクの種類や静的なルールでルーティングするのではなく、Jevはキャリブレーションでルーティングします。まず低コストのモデル(System One)が回答し、その確信度がしきい値を下回る場合は、リクエストをプレミアムモデルにエスカレーションします。FinOpsの観点では、低コストのモデルが本当に分からない場合にだけ、推論にコストを払うことになります。

仕組み

  1. System One Model(小型・高速・低コスト)が回答と、キャリブレーション済みの確信度スコアを生成します。
  2. Jevゲートウェイが確認します:確信度はしきい値(例:0.9)以上か(>=)。
  3. はいの場合:System Oneの回答を返します。コスト:約$0.10/1Mトークン。
  4. いいえの場合:プレミアムモデル(Astra、Opus 5.5など)にエスカレーションします。コスト:$10-50/1Mトークン。

コスト比較

戦略タスクあたり平均コスト精度
常にAstra(最大effort)$1.7350.9
常にSol$0.2844.2
静的ルーティング(易→Sol、難→Astra)$0.9448.1
Jevキャリブレーションルーティング(しきい値0.9)$0.4149.8

データはArtificial Analysis Intelligence Indexに対するJevのベンチマークによるものです。キャリブレーションルーティングは、Astraにほぼ並ぶ精度を24%のコストで実現します。

キャリブレーションが静的ルーティングに勝る理由

静的ルーティングは、タスクの15-20%を誤分類します(易しいタスクを難しいと判定、またはその逆)。キャリブレーションは自己修正的で、モデルが自分が分からないことを分かっている状態です。Jevのしきい値は調整可能で、精度を上げたいなら引き上げ、コストを下げたいなら引き下げます。

FinOpsでの実装

既存エージェントとの統合

JevはOpenAI互換のあらゆるエンドポイントをラップします。既存のエージェントは、モデルを直接呼び出す代わりにJevを呼び出します。エージェントのロジックにコード変更は不要で、変わるのはベースURLとAPIキーだけです。

まとめ

キャリブレーションベースのルーティングは、設計時ではなく推論時に最適化する、最初のFinOpsプリミティブです。System One + Jevにより、「どのモデルを使うか」は静的なアーキテクチャ上の決定から、リクエストごとの動的なコスト管理へと変わります。

関連記事


この方法を自社の環境にも適用しますか? プロバイダーの請求書、ゲートウェイログ、主要なワークフローをお持ちください。コスト要因と削減策を整理します。 無料監査を予約 →

finopsllm.com に戻る