30分でLLM支出を監査する方法

ほとんどのチームはLLM予算の内訳を把握していません。コストは、属性付けではなく合計を表示するプロバイダーのダッシュボード、異なる料金で請求されるトークンタイプ、週ごとに変化する使用パターンの裏に隠れています。このガイドでは、既にお手元のツールを使って30分で実行できる構造化された監査を提供します。

ステップ1 - プロバイダーから請求データを収集する

使用しているすべてのLLMプロバイダーから過去30日間の使用データをエクスポートします。OpenAIの場合は、Usage APIを使用するかダッシュボードからCSVをダウンロードします。Anthropicの場合は、Billing APIからデータを取得します。Googleの場合は、Cloud Billingコンソールからエクスポートします。セルフホストモデルの場合は、推論サーバーからリクエストログを取得します。すべてを1つのフォルダに保存します。要約ではなく生データが必要です。

ステップ2 - プロバイダー間でトークン数を正規化する

各プロバイダーはトークンを異なる方法でカウントします。OpenAIとAnthropicは独自のトークナイザーを使用し、GoogleはSentencePieceを使用します。比較するには、すべてのカウントを共通の単位に変換します。最も簡単なアプローチは、各プロバイダーが公開しているトークン単価を使用してリクエストあたりのコストを計算し、生のトークン数ではなくコストを直接比較することです。これによりトークナイザーの不一致を完全に回避できます。

ステップ3 - 入力、出力、キャッシュ、推論トークンに分割する

プロバイダーはトークンタイプによって異なる料金を請求します。キャッシュされた入力トークンは、OpenAIとAnthropicで通常50%安くなります。推論トークン(oシリーズや同様のモデルでは)は標準出力トークンの2〜4倍のコストになることがあります。支出を入力、出力、キャッシュ入力、推論の4つのバケットに分割します。プロバイダーがこの分割を公開していない場合は、モデルタイプとリクエストパターンから推定します。

ステップ4 - チームと機能に属性付ける

各APIキーまたはプロジェクトを、それを所有するチームまたは機能にマッピングします。キーレベルの分離がない場合は、リクエストメタデータ(ヘッダー、タグ、またはほとんどのプロバイダーがサポートするuserパラメーター)を使用します。目標は、どのチームがどの機能にいくら支出しているかというテーブルを作成することです。これなしでは、コストの責任を誰にも負わせることができません。

ステップ5 - トップ3のコストドライバーを特定する

総支出の降順でソートします。ほとんどの組織では、LLMコストの80%は3〜5の使用パターンから来ます。一般的なドライバー:長いコンテキストウィンドウを持つチャットボット、すべてのリクエストに高価なモデルを使用するコード生成機能、フィルタリングなしですべてのドキュメントで実行されるバックグラウンドエンリッチメントジョブ。名前をつけます。ここが最適化の集中ポイントです。

ステップ6 - 主要なワークフローのタスクあたりコストを計算する

上位3つのワークフローを選択します。各について、総支出を完了したタスク数で割ります。これにより、経時的に追跡できるユニットエコノミクスの数値が得られます。チケットあたり$0.12のカスタマーサポートワークフローは管理可能です。チケットあたり$1.40のワークフローは注意が必要です。絶対値よりもトレンドとワークフロー間の比較の方が重要です。

ステップ7 - 異常のアラートを設定する

2つのレベルでアラートを設定します:1日の総支出(暴走ジョブを検出)とワークフローごとの支出(ドリフトを検出)。ほとんどのプロバイダーは請求アラートをネイティブにサポートしています。プロバイダー横断のアラートについては、使用データをダッシュボードにパイプするか、MiMOのようなプロバイダーを集約するツールを使用します。シンプルなルール:いずれかの日の支出が過去7日間の平均の150%を超えた場合にアラートを出します。

クイック監査チェックリスト

ステップ必要なツール推定時間成果物
1. 請求データの収集プロバイダーのダッシュボードまたはAPI5分プロバイダーごとの生CSV/JSON
2. トークンの正規化スプレッドシートまたはスクリプト5分リクエストあたりコストテーブル
3. トークンタイプの分割トークン内訳のあるプロバイダーAPI5分入力/出力/キャッシュ/推論の分割
4. チームへの属性付けAPIキーマッピングまたはメタデータ5分チーム対機能コストマトリクス
5. 主要ドライバーの特定ソート/スプレッドシート3分コストパターンのランク付きリスト
6. タスクあたりコストアプリログからのタスク数5分ワークフローごとのユニットエコノミクス
7. アラートの設定プロバイダー請求アラート + ダッシュボード2分異常検知が有効

次のステップ

この監査はスナップショットを提供します。本当の価値は定期的な実行から来ます - 高支出チームは週次、その他は月次。データ収集を自動化し、タスクあたりコスト指標をファーストクラスの製品指標にします。これを継続的なプロセスとして構築する助けが必要な場合は、MiMOがプロバイダー横断ダッシュボードと自動属性付けをすぐに提供します。

関連項目


これをご自身のLLM支出に適用しませんか?FinOps LLMはAIコストの無料監査を実行し、削減のポイントを示します。無料監査を予約 →

リサーチに戻る