本文へ移動

サイレントなモデル格下げとコストモデル

更新日 September 27, 2026 · 初回公開 September 27, 2026

2026年9月23日、r/GroundTruthAINewsのスレッドが、AnthropicのOpus 5.5ローンチノートに埋もれた脚注を指摘しました。Opus 5.5へのリクエストをOpus 4.8が処理することがあるというものです。同じ日の午後、AnthropicとOpenAIはともに値下げを発表しました。両社が売り込んだのは同じ考え方、つまり性能は維持したまま支出を大幅に減らすというものです。FinOpsにとって重要なのは、その脚注のほうです。

実際に何が起きたか

Claude Opus 5.5は100万トークンあたり$4/$20でローンチされ、Opus 5より約20%安く、キャッシュ読み取りは60%引き下げられて$0.20になりました。Anthropicは、タスクあたりのトークン減少と30%の出力高速化により、典型的なワークロードは約40%安くなると述べています。その約90分後、OpenAIはGPT-6 Solを$2/$10、Lunaを$0.10/$0.50で発表しました。どちらもGPT-5.6の半額です。

この時期のローンチ記事には、いずれも同種の脚注が付いています。呼び出しているエンドポイントはエイリアスであり、移行期間中はそのエイリアスが複数のモデルバージョンに負荷分散される、というものです。これは通常のキャパシティ運用ですが、コストモデリングの観点では問題になります。

なぜ数字が狂うのか

切り替わりを検出する方法

主要なプロバイダーはすべて、レスポンスボディに解決後のモデルを返します。それをログに残してください。フィールドは1つ、コードは4行です。

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

そのうえで、すべてのコスト指標を、リクエストしたモデルではなく解決後のモデルで分割します。あるバケットがずれ始めた時点で答えが出ます。エイリアスがバージョンを混ぜており、タスクあたりコストは2つの異なる製品の加重平均になっているのです。

予算への影響

移行期間中は、見出しの数字ではなく混合後のコストで計画してください。呼び出しの20%が旧モデルに回るなら、実効的な入力単価は100万トークンあたり$4.00ではなく、混合の結果として決まる値になります。— 宣伝される節約額にも同じ理屈が当てはまります。「40%安い」は典型的なワークロードの平均値で、すでにトークン数の削減を前提にしています。安価だが旧型のモデルのほうが長い回答を生成する場合、その前提は成り立たないかもしれません。

守るべきルール

  1. エイリアスでモデル化しない。予算化や評価の対象には、日付付きのモデルIDを固定してください。
  2. すべてのリクエストで解決後のモデルをログに残す。評価を再実行する可能性があるなら、これは必須です。
  3. 移行期間の終了後にベースラインを取り直す。通常は四半期ではなく数週間ですが、確認してください。
  4. 移行は混合として価格設定する。プロバイダーに想定される配分を尋ねるか、自分で測定してください。

まとめ

値下げとサイレントな格下げは、同じ日の午後に同時に起こり得ます。値下げは見出しで、格下げは先月の予測を静かに無効にする脚注です。解決後のモデルをログに残し、日付付きIDを固定し、混合を踏まえて価格を見積もってください。

関連記事


この方法を自社の環境にも適用しますか? プロバイダーの請求書、ゲートウェイログ、主要なワークフローをお持ちください。コスト要因と削減策を整理します。 無料監査を予約 →

finopsllm.com に戻る