オープンソース vs. クローズド:LLMコスト比較

更新 2026年7月15日 · 初出 2026年7月4日

Llama、Qwen、DeepSeekをセルフホスティングするのは、APIアクセスに対して、いつ損益分岐点に達するのでしょうか。この分析はGPUコスト、推論最適化、運用オーバーヘッド、および特定のワークロードに対する意思決定フレームワークを提供します。

8比較モデル
5分析GPU層
3損益分岐点シナリオ
Jul 2026最終更新

方法論

API価格

各プロバイダーの価格ページからの標準発表料金。ボリューム割引またはバッチ割引は適用されません。

クラウドGPUセルフホスト

推論最適化セットアップ用クラウドオンデマンド価格(Lambda、RunPod、AWS)vLLMまたはTensorRT-LLM搭載。

運用オーバーヘッド

モニタリング、スケーリング、モデル更新、および管理インフラストラクチャ用の生GPUコストに対する15%運用サーチャージが含まれます。

品質ギャップ

GPT-4o / Claude Sonnet 4相対の100%ベースラインで。公開ベンチマークと実際のタスクパフォーマンスに基づく。

コスト比較表

モデル APIコスト/月 セルフホストコスト(クラウドGPU) 損益分岐点ボリューム 品質ギャップ
Llama 4 Maverick (DeepInfra) $260/月 $2,800/月 ~350Mトークン/月 ~95% of GPT-4o
Llama 3.3 70B (Groq) $277/月 $1,200/月 ~210Mトークン/月 ~87% of GPT-4o
Llama 4 Scout (Groq) $136/月 $1,400/月 ~350Mトークン/月 ~88% of GPT-4o
Qwen 3.7-Max $525/月 $1,600/月 ~100Mトークン/月 ~92% of GPT-4o
DeepSeek V4 Pro $435/月 $1,800/月 ~130Mトークン/月 ~96% of GPT-4o
DeepSeek V4 Flash $140/月 $1,400/月 ~450Mトークン/月 ~82% of GPT-4o
Mistral Medium 3.5 $525/月 $2,000/月 ~120Mトークン/月 ~91% of GPT-4o
GPT-4o (APIのみ) $750/月 N/A N/A ベースライン(100%)

APIコスト/月は標準料金で月間100M出力トークン+300M入力トークンを想定します。

セルフホストコストにはGPUレンタル、15%運用オーバーヘッド、推論スタック(vLLM)が含まれます。初期セットアップエンジニアリング時間は含まれません。

損益分岐点ボリュームは、セルフホスティングがAPIより安くなる月間出力トークン数です。

品質ギャップは概算であり、タスク依存です。MMLU、HumanEval、GPQA等のベンチマークがこれらの推定値を通知します。

一部のリンクには紹介コードが含まれている場合があります。

主要なコスト要因

1) GPUレンタルが支配的なコスト

Llama 4 Maverick用8x H100ノードはLambda、RunPod、またはAWSからのオンデマンドで月2,000~3,500ドルです。スポット/先制可能インスタンスはこれを40-60%削減できますが、再起動レイテンシーと可用性リスクが追加されます。本番ワークロードについて、予約インスタンス(1年契約)は通常オンデマンドより30-40%節約できます。

2) 推論最適化が方程式を変える

連続バッチング、KVキャッシュページング、および量子化(GPTQ/AWQ 4ビット)によるvLLMは、同じハードウェアで2-4倍のスループットを増加させることができます。TensorRT-LLMはサポートされているアーキテクチャに対してさらに20-40%を追加します。単一A100上の4ビット量子化Llama 4 Scoutは、2x A100上のナイーブfp16セットアップと同等になることができます。

3) 運用オーバーヘッドは実質的ですが減少しています

推論インフラストラクチャの実行にはGPUモニタリング、モデル更新、負荷分散、およびフェイルオーバーが必要です。生GPUコストの15-25%をオペレーション費用で予算してください。管理プラットフォーム(Anyscale、Modal、Replicate)はこれを吸収しますが、生GPUに対して30-50%プレミアムを請求しています-GPU支出が~$5K/月未満の場合に価値があります。

4) プロンプトキャッシングはAPIのギャップを狭めます

APIプロバイダーはプロンプトキャッシング(繰り返されるプレフィックスで50-90%割引)をますます提供しています。ワークロードがキャッシュフレンドリー(RAG、マルチターン)の場合、APIコストは大幅に低下し、セルフホスティングの損益分岐点ボリュームが上がります。

意思決定フレームワーク

APIを使用する場合...

  • 月間出力ボリュームが100Mトークン未満
  • フロンティアモデルの品質が必要(GPT-4o、Claude Opus 4)
  • チームがGPU/MLOpsの専門知識を持たない
  • レイテンシー要件が厳しい(TTFT<200ms)
  • 運用オーバーヘッドをゼロにしたい
  • ワークロードがバースト状またはシーズン的

セルフホストする場合...

  • 月間出力ボリュームが一貫して200Mトークンを超える
  • データプライバシーがサードパーティAPIアクセスを要求しない
  • カスタムファインチューニングモデルが必要
  • チームがMLOps能力を持っている
  • ワークロードが定常状態(予測可能なGPU利用)
  • 1年予約GPUインスタンスを約束できる

ハイブリッドアプローチ:実用的な中間地点

ほとんどのチームはハイブリッドになります:フロンティア推論タスクと低ボリュームワークロードにはAPIを使用し、高ボリューム、レイテンシー許容度の高いタスク(コンテンツ生成、データ抽出、内部ツール)にはオープンソースモデルをセルフホストします。これにより、APIコスト支出を制御下に保ちながら、セルフホスト機能を段階的に構築できます。

オープンソースモデルをどこで実行するか

プラットフォーム GPUオプション A100 80GB価格 H100価格 管理推論
Lambda Cloud A100, H100, H200 $1.10/時間 $2.49/時間 いいえ(自分のものを持参)
RunPod A100, H100, L40S $1.19/時間 $2.69/時間 サーバーレスオプション
AWS (p4d/p5) A100, H100 $3.67/時間 $6.37/時間 SageMaker
Google Cloud A100, H100 $3.22/時間 $5.07/時間 Vertex AI
Xiaomi MiMO ↗ APIベース N/A N/A API ($0.50/$2.00 per 1M)

GPU価格は2026年7月時点のオンデマンド時間単価です。予約/スポット価格は大きく異なります。

MiMOはMiMo-V2-ProおよびMiMo-V2-OmniへのAPIベースアクセスを競争力のある料金で提供します-完全なセルフホスティングとプレミアムAPI価格の中間。


独自のLLM支出にこれを適用したいですか?FinOps LLMはAIコストの無料監査を実施し、節約場所を示します。無料監査を予約 →

リサーチに戻る