オープンソース vs. クローズド:LLMコスト比較
更新 2026年7月15日 · 初出 2026年7月4日
Llama、Qwen、DeepSeekをセルフホスティングするのは、APIアクセスに対して、いつ損益分岐点に達するのでしょうか。この分析はGPUコスト、推論最適化、運用オーバーヘッド、および特定のワークロードに対する意思決定フレームワークを提供します。
- セルフホストコストはクラウドGPU価格を想定(オンデマンド)
- APIコストはプロバイダーごとの標準出力価格を使用
- 損益分岐点は70%利用率、24/7可用性に基づく
方法論
API価格
各プロバイダーの価格ページからの標準発表料金。ボリューム割引またはバッチ割引は適用されません。
クラウドGPUセルフホスト
推論最適化セットアップ用クラウドオンデマンド価格(Lambda、RunPod、AWS)vLLMまたはTensorRT-LLM搭載。
運用オーバーヘッド
モニタリング、スケーリング、モデル更新、および管理インフラストラクチャ用の生GPUコストに対する15%運用サーチャージが含まれます。
品質ギャップ
GPT-4o / Claude Sonnet 4相対の100%ベースラインで。公開ベンチマークと実際のタスクパフォーマンスに基づく。
コスト比較表
| モデル ↕ | APIコスト/月 ↕ | セルフホストコスト(クラウドGPU) ↕ | 損益分岐点ボリューム ↕ | 品質ギャップ |
|---|---|---|---|---|
| Llama 4 Maverick (DeepInfra) | $260/月 | $2,800/月 | ~350Mトークン/月 | ~95% of GPT-4o |
| Llama 3.3 70B (Groq) | $277/月 | $1,200/月 | ~210Mトークン/月 | ~87% of GPT-4o |
| Llama 4 Scout (Groq) | $136/月 | $1,400/月 | ~350Mトークン/月 | ~88% of GPT-4o |
| Qwen 3.7-Max | $525/月 | $1,600/月 | ~100Mトークン/月 | ~92% of GPT-4o |
| DeepSeek V4 Pro | $435/月 | $1,800/月 | ~130Mトークン/月 | ~96% of GPT-4o |
| DeepSeek V4 Flash | $140/月 | $1,400/月 | ~450Mトークン/月 | ~82% of GPT-4o |
| Mistral Medium 3.5 | $525/月 | $2,000/月 | ~120Mトークン/月 | ~91% of GPT-4o |
| GPT-4o (APIのみ) | $750/月 | N/A | N/A | ベースライン(100%) |
APIコスト/月は標準料金で月間100M出力トークン+300M入力トークンを想定します。
セルフホストコストにはGPUレンタル、15%運用オーバーヘッド、推論スタック(vLLM)が含まれます。初期セットアップエンジニアリング時間は含まれません。
損益分岐点ボリュームは、セルフホスティングがAPIより安くなる月間出力トークン数です。
品質ギャップは概算であり、タスク依存です。MMLU、HumanEval、GPQA等のベンチマークがこれらの推定値を通知します。
一部のリンクには紹介コードが含まれている場合があります。
主要なコスト要因
1) GPUレンタルが支配的なコスト
Llama 4 Maverick用8x H100ノードはLambda、RunPod、またはAWSからのオンデマンドで月2,000~3,500ドルです。スポット/先制可能インスタンスはこれを40-60%削減できますが、再起動レイテンシーと可用性リスクが追加されます。本番ワークロードについて、予約インスタンス(1年契約)は通常オンデマンドより30-40%節約できます。
2) 推論最適化が方程式を変える
連続バッチング、KVキャッシュページング、および量子化(GPTQ/AWQ 4ビット)によるvLLMは、同じハードウェアで2-4倍のスループットを増加させることができます。TensorRT-LLMはサポートされているアーキテクチャに対してさらに20-40%を追加します。単一A100上の4ビット量子化Llama 4 Scoutは、2x A100上のナイーブfp16セットアップと同等になることができます。
3) 運用オーバーヘッドは実質的ですが減少しています
推論インフラストラクチャの実行にはGPUモニタリング、モデル更新、負荷分散、およびフェイルオーバーが必要です。生GPUコストの15-25%をオペレーション費用で予算してください。管理プラットフォーム(Anyscale、Modal、Replicate)はこれを吸収しますが、生GPUに対して30-50%プレミアムを請求しています-GPU支出が~$5K/月未満の場合に価値があります。
4) プロンプトキャッシングはAPIのギャップを狭めます
APIプロバイダーはプロンプトキャッシング(繰り返されるプレフィックスで50-90%割引)をますます提供しています。ワークロードがキャッシュフレンドリー(RAG、マルチターン)の場合、APIコストは大幅に低下し、セルフホスティングの損益分岐点ボリュームが上がります。
意思決定フレームワーク
APIを使用する場合...
- 月間出力ボリュームが100Mトークン未満
- フロンティアモデルの品質が必要(GPT-4o、Claude Opus 4)
- チームがGPU/MLOpsの専門知識を持たない
- レイテンシー要件が厳しい(TTFT<200ms)
- 運用オーバーヘッドをゼロにしたい
- ワークロードがバースト状またはシーズン的
セルフホストする場合...
- 月間出力ボリュームが一貫して200Mトークンを超える
- データプライバシーがサードパーティAPIアクセスを要求しない
- カスタムファインチューニングモデルが必要
- チームがMLOps能力を持っている
- ワークロードが定常状態(予測可能なGPU利用)
- 1年予約GPUインスタンスを約束できる
ハイブリッドアプローチ:実用的な中間地点
ほとんどのチームはハイブリッドになります:フロンティア推論タスクと低ボリュームワークロードにはAPIを使用し、高ボリューム、レイテンシー許容度の高いタスク(コンテンツ生成、データ抽出、内部ツール)にはオープンソースモデルをセルフホストします。これにより、APIコスト支出を制御下に保ちながら、セルフホスト機能を段階的に構築できます。
オープンソースモデルをどこで実行するか
| プラットフォーム | GPUオプション | A100 80GB価格 | H100価格 | 管理推論 |
|---|---|---|---|---|
| Lambda Cloud | A100, H100, H200 | $1.10/時間 | $2.49/時間 | いいえ(自分のものを持参) |
| RunPod | A100, H100, L40S | $1.19/時間 | $2.69/時間 | サーバーレスオプション |
| AWS (p4d/p5) | A100, H100 | $3.67/時間 | $6.37/時間 | SageMaker |
| Google Cloud | A100, H100 | $3.22/時間 | $5.07/時間 | Vertex AI |
| Xiaomi MiMO ↗ | APIベース | N/A | N/A | API ($0.50/$2.00 per 1M) |
GPU価格は2026年7月時点のオンデマンド時間単価です。予約/スポット価格は大きく異なります。
MiMOはMiMo-V2-ProおよびMiMo-V2-OmniへのAPIベースアクセスを競争力のある料金で提供します-完全なセルフホスティングとプレミアムAPI価格の中間。
独自のLLM支出にこれを適用したいですか?FinOps LLMはAIコストの無料監査を実施し、節約場所を示します。無料監査を予約 →