LLM費用配分
LLM費用配分は、プロバイダー請求書と運用上の決定の間の橋です。プロバイダーはアカウント、モデル、トークンクラス、および時々地域または機能で請求します。企業は、チーム、製品、顧客、ワークフロー、および値のユニット別の支出を理解する必要があります。配分レイヤーは、生の請求書との照合を失わずに、これら2つのビューを接続します。
重要なのは、リクエストがプロバイダーまたはゲートウェイに到達する前にラベルを付けることです。事後的に作成されたレコードは、通常は不完全です。最低限として、本番環境のすべてのLLM呼び出しは、安定したエンドポイント名、環境、チーム所有者、製品表面、ワークロードクラス、および相関IDを運ぶ必要があります。契約が許可する場所では、テナントまたは顧客IDを追加します。エージェントワークフローの場合、各ツール呼び出しまたはモデルステップを個別にラベル付けします。
リクエスト数は配分ではない
リクエスト数による支出の割り当てはほぼ常に間違っています。長いコンテキスト推論リクエストは、数百の短い分類呼び出しよりも費用がかかる可能性があります。配分はトークンクラスとモデル価格が必要です。また、リトライとフォールバックのデータが必要です。「成功した」応答は、以前の3つの失敗した呼び出しを隠す可能性があるからです。
推奨される寸法
- プロバイダー、モデル、およびモデルバージョン(利用可能な場合)。
- 入力、出力、キャッシュ書き込み、キャッシュ読み取り、および推論のトークンクラス。
- チーム、製品、機能、エンドポイント、および環境。
- ワークロードクラス:リアルタイムユーザーパス、バックグラウンド作業、評価、エンリッチメント、エージェントステップ、サポートワークフロー、または分析タスク。
- プライバシーと契約境界が許可する場合の顧客またはテナント配分。
請求書の照合
配分はプロバイダー請求書と照合されて戻る必要があります。丸め、遅延請求行、およびプロバイダー固有の割引による小さな違いを期待しますが、大きなギャップは、レコードパイプラインがトラフィックを失っているか、古い価格表を使用していることを意味します。ファイナンスビューは、配分された支出と未割り当ての支出の両方を表示して、データ品質の問題が見えるようにする必要があります。
ショーバックからアクションへ
最初の結果はショーバックである必要があります:どのチームと製品表面が支出を駆動しているか、および先月からどのワークロードが変更されたか。チームがそのデータを信頼したら、それを使用して最適化作業をランク付けします。配分は、ルーティング、キャッシュ、またはプロンプト変更を承認できる所有者に直接指摘するため、価値があります。
関連
- OpenAI費用配分 - OpenAI固有の配分パターン。
- LLMチャージバックとショーバック - 支出を所有者に移動。
- LLM FinOpsとは? - 完全な運用規律。
自分のLLM支出に適用したいですか?FinOps LLMはAI費用の無料監査を実施し、節約場所を示します。無料監査を予約 →