Chiffrer un modèle à poids ouverts
Updated September 1, 2026 · first published September 1, 2026
Qwen3.8-Flash-Next est arrivé le 26 août 2026 comme préversion à poids ouverts de l’architecture Qwen4 : environ 6 milliards de paramètres actifs, un contexte natif de 262 144 tokens, et aucun tarif hébergé annoncé. La comparaison habituelle ne tient plus : un modèle fermé fournit un prix au million de tokens; des poids ouverts fournissent un checkpoint et vous laissent le calcul.
La formule
coût par MTok = prix_horaire / (tokens_par_seconde * 3600) * 1 000 000À 2,00 $ l’heure et 1 500 tokens par seconde mesurés, cela fait 0,37 $ par million de tokens. Face à une API à 3,00 $/MTok, l’économie semble d’un facteur huit. Ce chiffre est faux : il suppose que le GPU travaille chaque seconde que vous payez.
Le terme oublié : le taux d’utilisation
Vous louez l’heure, vous en utilisez une fraction. Divisez par cette fraction : 0,62 $ à 60 %, 1,23 $ à 30 %, 3,70 $ à 10 % — plus cher que l’API à remplacer. La plupart des premiers déploiements se situent entre 10 et 30 %, parce que le trafic est irrégulier et l’instance dimensionnée pour le pic. L’économie est réelle, mais elle porte sur l’utilisation, pas sur les poids.
Mesurez avant de vous engager
Faites tourner le modèle sur l’instance que vous loueriez réellement, avec vos prompts et vos longueurs de contexte, et relevez les tokens par seconde en concurrence — pas le chiffre en flux unique de la fiche modèle. Calculez ensuite le taux d’utilisation sur votre profil de trafic réel. Deux nombres, une division, la décision se prend seule. Chiffrez le contexte que vous envoyez, pas celui que le modèle accepte.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →