推論コストを静かに増やすリトライループ
Updated August 27, 2026 · first published August 27, 2026
リトライは無料の回復処理ではなく、追加のモデル呼び出しです。リトライとフォールバックの支出を推論支出全体で割り、ワークフロー別に測ります。
試行の木を記録する
親リクエスト、試行番号、プロバイダー、モデル、ツール、エラー、トークン、結果を記録します。入れ子の呼び出しには親子関係が必要です。
ループを制限する
エラー種別ごとに試行回数、トークン、金額、時間の上限を定めます。入力検証やコンテキスト超過を同じ条件で繰り返してはいけません。
すべてのリトライを無効にするのではなく、各試行を可視化し、上限を設け、成果の改善で正当化します。
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →