ガードレールとモデレーションの費用
Updated September 1, 2026 · first published September 1, 2026
本番の LLM 機能が呼び出しを 1 回だけ行うことはまれです。設計した呼び出しに加えて、後から安全のために足した呼び出しがあります — 入力分類器、出力チェック、ポリシー判定、ときには 1 本目を採点する 2 本目のモデル。どれも推論であり、推論は課金されます。
倍率は見た目より大きい
入力モデレーションは入力全体を読み、出力モデレーションは生成された応答全体を読みます。判定モデルはその両方に加えて検索コンテキストと評価基準まで読むため、判定される呼び出しより判定する呼び出しのほうが大きくなります。
支出が積み上がる場所
典型は 3 つ。フロンティアモデルで判定する(分類こそ小型モデルで十分な唯一の用途で、たいていここが最大の削減余地)。毎ターン検査する(承認済みの履歴を再走査)。そして社内トラフィックへのガードレール(評価ハーネスや社内ツールが、必要のない対外向け安全スタックをそのまま継承)。
丸め誤差ではなく費目として
チェックをやめる話ではありません。安全スタックが機能の推論コストの 30–50% を占めていながら、計画のどこにも出てこないことがある、という話です。答えるモデルは数えても、検査するモデルは誰も数えていないからです。
ガードレール呼び出しはテレメトリで別タグにして比率を可視化し、必要な精度を満たす最小のモデルを使い、履歴全体ではなく新規部分だけを検査し、どのトラフィックにどのチェックが本当に要るかを面ごとに決めてください。
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →