本番外の LLM 支出
Updated September 1, 2026 · first published September 1, 2026
LLM 支出のレビューはいつも本番トラフィックから始まります。ダッシュボードがあるのがそこだけだからです。ところが環境別に分解すると、請求額のうち無視できない割合 — しばしば二桁パーセント — が一度も顧客に届いていないと分かります。
どこから来るのか
CI: 評価スイートを走らせるプルリクエストごとにモデルを呼び、最も高価なモデルで 1 日に数千回になります。ローカル開発: プロンプトの調整は 1 時間に数十回の呼び出しで、共有キー、タグなしが普通です。ステージングとデモ: 本番と同じ構成、つまり高価なモデルでキャッシュなし。テスト中のリトライや暴走ループは誰も見ていません。
コストより先に帰属を直す
投資が確実に回収できる変更は環境ごとに別の API キーを持つことです。半日で終わり、説明のつかない 1 行が 4 つのラベル付きの行になります。各リクエストに環境を、CI ではリポジトリとワークフローもタグ付けします。
見えるようになれば結論は自然に出ます。本番外はより小さいモデルでほぼ問題ありません。CI はほぼ同一のプロンプトを繰り返すので、キャッシュの効果が最も大きい場所です。そして厳格な上限を安全に置けるのもここだけです — 上限に達したテスト環境はビルドを落としますが、本番環境は顧客を落とします。
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →