サイレントなモデル格下げとコストモデル
更新日 September 27, 2026 · 初回公開 September 27, 2026
2026年9月23日、r/GroundTruthAINewsのスレッドが、AnthropicのOpus 5.5ローンチノートに埋もれた脚注を指摘しました。Opus 5.5へのリクエストをOpus 4.8が処理することがあるというものです。同じ日の午後、AnthropicとOpenAIはともに値下げを発表しました。両社が売り込んだのは同じ考え方、つまり性能は維持したまま支出を大幅に減らすというものです。FinOpsにとって重要なのは、その脚注のほうです。
実際に何が起きたか
Claude Opus 5.5は100万トークンあたり$4/$20でローンチされ、Opus 5より約20%安く、キャッシュ読み取りは60%引き下げられて$0.20になりました。Anthropicは、タスクあたりのトークン減少と30%の出力高速化により、典型的なワークロードは約40%安くなると述べています。その約90分後、OpenAIはGPT-6 Solを$2/$10、Lunaを$0.10/$0.50で発表しました。どちらもGPT-5.6の半額です。
この時期のローンチ記事には、いずれも同種の脚注が付いています。呼び出しているエンドポイントはエイリアスであり、移行期間中はそのエイリアスが複数のモデルバージョンに負荷分散される、というものです。これは通常のキャパシティ運用ですが、コストモデリングの観点では問題になります。
なぜ数字が狂うのか
- タスクあたりコストがずれる。予測はOpus 5.5の出力価格を前提にしていました。呼び出しの一部が4.8に回ると、単価とトークン数の両方が、逆方向に動きます。
- 評価は混合を測っている。移行期間中に実行した評価スイートは、複数バージョンの混合をスコアリングします。そのスコアは後から再現できません。
- 値下げの効果が誤って帰属される。40%の節約が15%にしか見えない場合、その差は最適化の失敗ではなく、たいていバージョンの混在です。
- レイテンシの基準値が古くなる。4.8は5.5ほど速くありません。移行の最中に取得したp50は、定常状態のp50ではありません。
切り替わりを検出する方法
主要なプロバイダーはすべて、レスポンスボディに解決後のモデルを返します。それをログに残してください。フィールドは1つ、コードは4行です。
resolved = response.model # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKSそのうえで、すべてのコスト指標を、リクエストしたモデルではなく解決後のモデルで分割します。あるバケットがずれ始めた時点で答えが出ます。エイリアスがバージョンを混ぜており、タスクあたりコストは2つの異なる製品の加重平均になっているのです。
予算への影響
移行期間中は、見出しの数字ではなく混合後のコストで計画してください。呼び出しの20%が旧モデルに回るなら、実効的な入力単価は100万トークンあたり$4.00ではなく、混合の結果として決まる値になります。— 宣伝される節約額にも同じ理屈が当てはまります。「40%安い」は典型的なワークロードの平均値で、すでにトークン数の削減を前提にしています。安価だが旧型のモデルのほうが長い回答を生成する場合、その前提は成り立たないかもしれません。
守るべきルール
- エイリアスでモデル化しない。予算化や評価の対象には、日付付きのモデルIDを固定してください。
- すべてのリクエストで解決後のモデルをログに残す。評価を再実行する可能性があるなら、これは必須です。
- 移行期間の終了後にベースラインを取り直す。通常は四半期ではなく数週間ですが、確認してください。
- 移行は混合として価格設定する。プロバイダーに想定される配分を尋ねるか、自分で測定してください。
まとめ
値下げとサイレントな格下げは、同じ日の午後に同時に起こり得ます。値下げは見出しで、格下げは先月の予測を静かに無効にする脚注です。解決後のモデルをログに残し、日付付きIDを固定し、混合を踏まえて価格を見積もってください。
関連記事
この方法を自社の環境にも適用しますか? プロバイダーの請求書、ゲートウェイログ、主要なワークフローをお持ちください。コスト要因と削減策を整理します。 無料監査を予約 →