Suivi des Prix des API LLM

Mise à jour 15 juillet 2026 · publié pour la première fois le 4 juillet 2026

Suivi des prix par jeton auprès de tous les grands fournisseurs LLM. Entrée, sortie, lecture/écriture de cache, fenêtres de contexte et remises par lot dans une seule table normalisée. Mis à jour mensuellement avec des données vérifiables des fournisseurs.

12+Fournisseurs suivi
25+Modèles listés
6Colonnes de prix
Jul 2026Dernière mise à jour

Méthodologie

Collecte

Les données tarifaires sont collectées auprès des pages de tarification officielles et de la documentation API des fournisseurs.

Normalisation

Tous les prix sont normalisés en USD par 1 million de jetons pour une comparaison directe.

Tarification du cache

Les colonnes Lecture/Écriture du cache affichent les remises du cache des prompts lorsqu'elles sont disponibles auprès des fournisseurs.

Politique d'affichage

Les valeurs officielles et estimées sont clairement séparées. Les estimations sont marquées en gris.

Historique des Mises à Jour

4 juil 2026

Suivi des Prix des API LLM lancé

Publication de la comparaison des prix par jeton auprès de plus de 12 grands fournisseurs LLM en tant qu'article de recherche FinOps LLM.

Tableau des Prix par Jeton

Fournisseur Modèle Entrée $/1M Sortie $/1M Lecture Cache $/1M Écriture Cache $/1M Fenêtre Contexte Remise par Lot
OpenAI GPT-5.6-Sol $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.6-Terra $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI GPT-5.6-Luna $1.00 $6.00 $0.10 $1.25 128K 50%
OpenAI GPT-5.5 $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.4 $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI o3 $2.00 $8.00 $0.50 $2.00 200K 50%
OpenAI o4-mini $1.10 $4.40 $0.28 $1.10 200K 50%
Anthropic Claude Fable 5 $10.00 $50.00 $1.00 $12.50 200K 50%
Anthropic Claude Opus 4.8 $5.00 $25.00 $0.50 $6.25 200K 50%
Anthropic Claude Sonnet 5* $2.00 $10.00 $0.20 $2.50 200K 50%
Anthropic Claude Haiku 4.5 $1.00 $5.00 $0.10 $1.25 200K 50%
Google Gemini 3.5 Flash $1.50 $9.00 $0.15 $1.88 1M 50%
Google Gemini 3.1 Pro Preview $2.00 $12.00 $0.20 $2.50 1M 50%
Google Gemini 2.5 Pro $1.25 $5.00 $0.31 $4.50 1M 50%
Google Gemini 2.5 Flash $0.15 $0.60 $0.04 $0.15 1M 50%
xAI Grok 4.5 $2.00 $6.00 $0.50 $1.50 1M 50%
xAI Grok 4.3 $1.25 $2.50 - - 1M 50%
Meta Llama 4 Maverick (DeepInfra) $0.20 $0.80 - - 1M -
Meta Llama 4 Scout (Groq) $0.11 $0.34 - - 5M -
Meta Llama 3.3 70B (Groq) $0.59 $0.79 - - 8M -
Mistral Mistral Large 2/3 $2.00 $6.00 - - 128K -
Mistral Mistral Medium 3.5 $1.50 $7.50 - - 128K -
Mistral Mistral Small 3 $0.10 $0.30 - - 128K -
Mistral Codestral $0.30 $0.90 - - 128K -
DeepSeek DeepSeek V4 Flash $0.14 $0.28 $0.0028 - 128K -
DeepSeek DeepSeek V4 Pro $0.435 $0.87 $0.0036 - 128K -
Alibaba Qwen Qwen 3.7-Max $2.50 $7.50 - - 131K -
Moonshot Kimi Kimi K2.6 $0.95 $4.00 $0.16 - 200K -
Xiaomi MiMO
S'inscrire - tous deux obtiennent 2 $ ↗
MiMo-V2-Pro $0.50 $2.00 - - 128K -
Xiaomi MiMO
S'inscrire - tous deux obtiennent 2 $ ↗
MiMo-V2-Omni $0.40 $1.60 - - 128K -
Zhipu AI GLM-5 $1.00 $4.00 - - 128K -
Zhipu AI GLM-5-Turbo $0.30 $1.20 - - 128K -
MiniMax M2.7 $0.40 $1.60 - - 128K -
StepFun step-3.5-flash $0.30 $1.20 - - 128K -

* Claude Sonnet 5 : tarification introductive de 2 $/10 $ par 1 million de jetons en vigueur jusqu'au 31 août 2026 ; la tarification standard de 3 $/15 $ débute le 1er septembre 2026.

Les valeurs non explicitement fournies par les fournisseurs sont affichées en gris.

Les prix de Meta Llama reflètent les tarifs des API hébergées (Fireworks, Together, etc.), et non le coût d'auto-hébergement. L'économie de l'auto-hébergement est couverte dans notre Comparaison des Coûts Open-Source vs Propriétaire.

Les fenêtres de contexte sont les maximums supportées ; la disponibilité réelle peut varier selon le niveau.

La tarification du cache de lecture/écriture reflète le cache de prompts spécifique au fournisseur où il est disponible. « - » signifie que le fournisseur n'offre pas de cache ou que le prix n'est pas publié.

La Remise par Lot affiche les économies approximatives lors de l'utilisation des API par lot/asynchrones où disponibles.

Certains liens peuvent inclure des codes de parrainage.

Les prix peuvent changer fréquemment. Vérifiez toujours les informations les plus récentes sur les pages officielles des fournisseurs.

Guide Pratique

Comment utiliser ces données tarifaires pour la planification des coûts

1) Calculez d'abord votre volume de jetons

Avant de comparer les prix, estimez vos volumes mensuels de jetons d'entrée et de sortie. Les jetons de sortie sont généralement 3 à 5 fois plus chers que ceux d'entrée, donc réduire la longueur de sortie a le plus grand impact sur le coût.

2) Tenez compte des économies de cache

Si votre charge de travail a des prompts système ou du contexte répétés (RAG, conversations multi-tours), le cache de prompts peut réduire les coûts d'entrée de 50 à 90 %. Consultez la colonne Lecture du Cache pour les remises applicables.

3) Utilisez les API par lot pour le travail non urgent

La plupart des grands fournisseurs offrent des remises de 50 % sur les appels d'API par lot/asynchrones. Si votre charge de travail tolère la latence (évaluations, traitement des données, génération de contenu), la tarification par lot réduit les coûts de moitié.

4) Comparez le coût total, pas seulement le prix par jeton

Un modèle bon marché qui nécessite 3 fois plus de jetons pour égaler la qualité peut coûter plus cher au total. Tenez compte de la qualité du modèle et des performances spécifiques à la tâche parallèlement à la tarification brute.


Vous voulez que cela soit appliqué à vos propres dépenses en LLM ? FinOps LLM effectue un audit gratuit de vos coûts d'IA et vous montre où se trouvent les économies. Réservez un audit gratuit →

Retour à la recherche