Suivi des Prix des API LLM
Mise à jour 15 juillet 2026 · publié pour la première fois le 4 juillet 2026
Suivi des prix par jeton auprès de tous les grands fournisseurs LLM. Entrée, sortie, lecture/écriture de cache, fenêtres de contexte et remises par lot dans une seule table normalisée. Mis à jour mensuellement avec des données vérifiables des fournisseurs.
- Tous les prix en USD par 1 million de jetons
- Les valeurs estimées sont affichées en gris
- Les prix du cache reflètent le cache des prompts où disponible
Méthodologie
Collecte
Les données tarifaires sont collectées auprès des pages de tarification officielles et de la documentation API des fournisseurs.
Normalisation
Tous les prix sont normalisés en USD par 1 million de jetons pour une comparaison directe.
Tarification du cache
Les colonnes Lecture/Écriture du cache affichent les remises du cache des prompts lorsqu'elles sont disponibles auprès des fournisseurs.
Politique d'affichage
Les valeurs officielles et estimées sont clairement séparées. Les estimations sont marquées en gris.
Historique des Mises à Jour
Suivi des Prix des API LLM lancé
Publication de la comparaison des prix par jeton auprès de plus de 12 grands fournisseurs LLM en tant qu'article de recherche FinOps LLM.
Tableau des Prix par Jeton
| Fournisseur ↕ | Modèle ↕ | Entrée $/1M ↕ | Sortie $/1M ↕ | Lecture Cache $/1M ↕ | Écriture Cache $/1M ↕ | Fenêtre Contexte ↕ | Remise par Lot |
|---|---|---|---|---|---|---|---|
| OpenAI | GPT-5.6-Sol | $5.00 | $30.00 | $0.50 | $6.25 | 128K | 50% |
| OpenAI | GPT-5.6-Terra | $2.50 | $15.00 | $0.25 | $3.13 | 128K | 50% |
| OpenAI | GPT-5.6-Luna | $1.00 | $6.00 | $0.10 | $1.25 | 128K | 50% |
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $0.50 | $6.25 | 128K | 50% |
| OpenAI | GPT-5.4 | $2.50 | $15.00 | $0.25 | $3.13 | 128K | 50% |
| OpenAI | o3 | $2.00 | $8.00 | $0.50 | $2.00 | 200K | 50% |
| OpenAI | o4-mini | $1.10 | $4.40 | $0.28 | $1.10 | 200K | 50% |
| Anthropic | Claude Fable 5 | $10.00 | $50.00 | $1.00 | $12.50 | 200K | 50% |
| Anthropic | Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | $6.25 | 200K | 50% |
| Anthropic | Claude Sonnet 5* | $2.00 | $10.00 | $0.20 | $2.50 | 200K | 50% |
| Anthropic | Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | $1.25 | 200K | 50% |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | $1.88 | 1M | 50% | |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | $0.20 | $2.50 | 1M | 50% | |
| Gemini 2.5 Pro | $1.25 | $5.00 | $0.31 | $4.50 | 1M | 50% | |
| Gemini 2.5 Flash | $0.15 | $0.60 | $0.04 | $0.15 | 1M | 50% | |
| xAI | Grok 4.5 | $2.00 | $6.00 | $0.50 | $1.50 | 1M | 50% |
| xAI | Grok 4.3 | $1.25 | $2.50 | - | - | 1M | 50% |
| Meta | Llama 4 Maverick (DeepInfra) | $0.20 | $0.80 | - | - | 1M | - |
| Meta | Llama 4 Scout (Groq) | $0.11 | $0.34 | - | - | 5M | - |
| Meta | Llama 3.3 70B (Groq) | $0.59 | $0.79 | - | - | 8M | - |
| Mistral | Mistral Large 2/3 | $2.00 | $6.00 | - | - | 128K | - |
| Mistral | Mistral Medium 3.5 | $1.50 | $7.50 | - | - | 128K | - |
| Mistral | Mistral Small 3 | $0.10 | $0.30 | - | - | 128K | - |
| Mistral | Codestral | $0.30 | $0.90 | - | - | 128K | - |
| DeepSeek | DeepSeek V4 Flash | $0.14 | $0.28 | $0.0028 | - | 128K | - |
| DeepSeek | DeepSeek V4 Pro | $0.435 | $0.87 | $0.0036 | - | 128K | - |
| Alibaba Qwen | Qwen 3.7-Max | $2.50 | $7.50 | - | - | 131K | - |
| Moonshot Kimi | Kimi K2.6 | $0.95 | $4.00 | $0.16 | - | 200K | - |
| Xiaomi MiMO S'inscrire - tous deux obtiennent 2 $ ↗ |
MiMo-V2-Pro | $0.50 | $2.00 | - | - | 128K | - |
| Xiaomi MiMO S'inscrire - tous deux obtiennent 2 $ ↗ |
MiMo-V2-Omni | $0.40 | $1.60 | - | - | 128K | - |
| Zhipu AI | GLM-5 | $1.00 | $4.00 | - | - | 128K | - |
| Zhipu AI | GLM-5-Turbo | $0.30 | $1.20 | - | - | 128K | - |
| MiniMax | M2.7 | $0.40 | $1.60 | - | - | 128K | - |
| StepFun | step-3.5-flash | $0.30 | $1.20 | - | - | 128K | - |
* Claude Sonnet 5 : tarification introductive de 2 $/10 $ par 1 million de jetons en vigueur jusqu'au 31 août 2026 ; la tarification standard de 3 $/15 $ débute le 1er septembre 2026.
Les valeurs non explicitement fournies par les fournisseurs sont affichées en gris.
Les prix de Meta Llama reflètent les tarifs des API hébergées (Fireworks, Together, etc.), et non le coût d'auto-hébergement. L'économie de l'auto-hébergement est couverte dans notre Comparaison des Coûts Open-Source vs Propriétaire.
Les fenêtres de contexte sont les maximums supportées ; la disponibilité réelle peut varier selon le niveau.
La tarification du cache de lecture/écriture reflète le cache de prompts spécifique au fournisseur où il est disponible. « - » signifie que le fournisseur n'offre pas de cache ou que le prix n'est pas publié.
La Remise par Lot affiche les économies approximatives lors de l'utilisation des API par lot/asynchrones où disponibles.
Certains liens peuvent inclure des codes de parrainage.
Les prix peuvent changer fréquemment. Vérifiez toujours les informations les plus récentes sur les pages officielles des fournisseurs.
Guide Pratique
Comment utiliser ces données tarifaires pour la planification des coûts
1) Calculez d'abord votre volume de jetons
Avant de comparer les prix, estimez vos volumes mensuels de jetons d'entrée et de sortie. Les jetons de sortie sont généralement 3 à 5 fois plus chers que ceux d'entrée, donc réduire la longueur de sortie a le plus grand impact sur le coût.
2) Tenez compte des économies de cache
Si votre charge de travail a des prompts système ou du contexte répétés (RAG, conversations multi-tours), le cache de prompts peut réduire les coûts d'entrée de 50 à 90 %. Consultez la colonne Lecture du Cache pour les remises applicables.
3) Utilisez les API par lot pour le travail non urgent
La plupart des grands fournisseurs offrent des remises de 50 % sur les appels d'API par lot/asynchrones. Si votre charge de travail tolère la latence (évaluations, traitement des données, génération de contenu), la tarification par lot réduit les coûts de moitié.
4) Comparez le coût total, pas seulement le prix par jeton
Un modèle bon marché qui nécessite 3 fois plus de jetons pour égaler la qualité peut coûter plus cher au total. Tenez compte de la qualité du modèle et des performances spécifiques à la tâche parallèlement à la tarification brute.
Vous voulez que cela soit appliqué à vos propres dépenses en LLM ? FinOps LLM effectue un audit gratuit de vos coûts d'IA et vous montre où se trouvent les économies. Réservez un audit gratuit →