System One ModelsとJevによるコスト最適化
更新日 September 27, 2026 · 初回公開 September 27, 2026
2026年9月に発表されたSystem One ModelsとJevは、LLMエージェント向けのキャリブレーションベースのルーティングレイヤーを構成します。タスクの種類や静的なルールでルーティングするのではなく、Jevはキャリブレーションでルーティングします。まず低コストのモデル(System One)が回答し、その確信度がしきい値を下回る場合は、リクエストをプレミアムモデルにエスカレーションします。FinOpsの観点では、低コストのモデルが本当に分からない場合にだけ、推論にコストを払うことになります。
仕組み
- System One Model(小型・高速・低コスト)が回答と、キャリブレーション済みの確信度スコアを生成します。
- Jevゲートウェイが確認します:確信度はしきい値(例:0.9)以上か(>=)。
- はいの場合:System Oneの回答を返します。コスト:約$0.10/1Mトークン。
- いいえの場合:プレミアムモデル(Astra、Opus 5.5など)にエスカレーションします。コスト:$10-50/1Mトークン。
コスト比較
| 戦略 | タスクあたり平均コスト | 精度 |
|---|---|---|
| 常にAstra(最大effort) | $1.73 | 50.9 |
| 常にSol | $0.28 | 44.2 |
| 静的ルーティング(易→Sol、難→Astra) | $0.94 | 48.1 |
| Jevキャリブレーションルーティング(しきい値0.9) | $0.41 | 49.8 |
データはArtificial Analysis Intelligence Indexに対するJevのベンチマークによるものです。キャリブレーションルーティングは、Astraにほぼ並ぶ精度を24%のコストで実現します。
キャリブレーションが静的ルーティングに勝る理由
静的ルーティングは、タスクの15-20%を誤分類します(易しいタスクを難しいと判定、またはその逆)。キャリブレーションは自己修正的で、モデルが自分が分からないことを分かっている状態です。Jevのしきい値は調整可能で、精度を上げたいなら引き上げ、コストを下げたいなら引き下げます。
FinOpsでの実装
- Jevをゲートウェイとして導入する:すべてのエージェントのトラフィックをJev経由にし、デフォルトはSystem Oneとします。
- ワークフローごとにしきい値を設定する:顧客向けチャット = 0.95、バックグラウンドのバッチ = 0.85。
- エスカレーション率を追跡する:目標は10-20%です。これより高い場合はSystem Oneの学習不足、低い場合は払い過ぎを意味します。
- プレミアム層の予算を設定する:月次のエスカレーション支出に上限を設け、80%でアラートを出します。
既存エージェントとの統合
JevはOpenAI互換のあらゆるエンドポイントをラップします。既存のエージェントは、モデルを直接呼び出す代わりにJevを呼び出します。エージェントのロジックにコード変更は不要で、変わるのはベースURLとAPIキーだけです。
まとめ
キャリブレーションベースのルーティングは、設計時ではなく推論時に最適化する、最初のFinOpsプリミティブです。System One + Jevにより、「どのモデルを使うか」は静的なアーキテクチャ上の決定から、リクエストごとの動的なコスト管理へと変わります。
関連記事
この方法を自社の環境にも適用しますか? プロバイダーの請求書、ゲートウェイログ、主要なワークフローをお持ちください。コスト要因と削減策を整理します。 無料監査を予約 →