Aller au contenu

Claude Haiku 5.5 et le seuil tarifaire de 100k tokens

Mis à jour October 8, 2026 · première publication October 8, 2026

Réponse rapide: Le prix affiché de Claude Haiku 5.5 dépend de la longueur du prompt. Anthropic a lancé le modèle le 7 octobre 2026 pour des usages à fort volume comme la classification, les résumés et les tâches de...

Le prix affiché de Claude Haiku 5.5 dépend de la longueur du prompt. Anthropic a lancé le modèle le 7 octobre 2026 pour des usages à fort volume comme la classification, les résumés et les tâches de sous-agents. Sa fenêtre de contexte de 1 million de tokens ne garantit pas que tous ces tokens coûtent le tarif des prompts courts : un prompt de plus de 100,000 tokens relève d'un palier de prix plus élevé. La taille des requêtes devient donc une décision budgétaire, surtout pour les agents qui accumulent des documents et des résultats d'outils.

La grille tarifaire a deux faces

Voici les prix standard publiés par Anthropic pour l'API Claude, en dollars américains par million de tokens, relevés le 8 octobre. Le seuil sépare les prompts jusqu'à 100,000 tokens de ceux de plus de 100,000 ; ce n'est pas un prix appliqué uniquement aux tokens au-delà du seuil. Consultez la documentation tarifaire en vigueur avant d'utiliser ces chiffres dans une prévision.

Catégorie de tokenPrompt jusqu'à 100kPrompt au-delà de 100k
Entrée sans cache$0.10$0.50
Sortie$0.50$2.50
Écriture en cache de 5 minutes$0.125$0.625
Écriture en cache d'1 heure$0.20$1.00
Lecture du cache$0.01$0.05

Chaque tarif par token indiqué est cinq fois plus élevé au-dessus du seuil. Cela ne signifie pas que toute la facture d'une application est multipliée par cinq : beaucoup d'appels peuvent rester courts, et le volume de sortie, la mise en cache, les outils, le traitement par lots, les relances et le taux de réussite des tâches influencent tous la dépense totale. Le contexte mis en cache occupe toujours le prompt ; un succès de cache ne transforme pas une requête de 120k tokens en prompt court.

À quoi ressemble le seuil sur une seule requête

Prenons deux appels illustratifs, sans cache ni outils facturés séparément, produisant chacun 1,000 tokens de sortie. Un prompt de 99,000 tokens coûte environ $0.0104 en entrée et sortie aux tarifs des prompts courts. Un prompt de 101,000 tokens coûte environ $0.0530 aux tarifs des prompts longs. C'est à peu près cinq fois plus pour une requête qui ne compte que 2,000 tokens d'entrée de plus. L'exemple garde la sortie fixe pour isoler le seuil tarifaire ; ce n'est pas une économie mesurée en production. Les vrais prompts contiennent aussi des instructions système, l'historique de conversation, des schémas d'outils et des résultats d'outils.

Recomptez avant de migrer

Les notes de migration d'Anthropic indiquent que le même texte produit environ 30 % de tokens en plus sur Haiku 5.5 que sur Haiku 4.5, avec des variations selon le contenu. Un prompt qui semblait nettement sous 100k avec les anciens décomptes peut franchir le nouveau seuil. Ne multipliez pas tous les anciens décomptes par 1.3 pour en faire une prévision de facture ; recomptez des requêtes représentatives avec claude-haiku-5-5.

Le endpoint de comptage de tokens d'Anthropic accepte le message structuré, le prompt système et les outils client pris en charge avant l'envoi de la requête de génération. Comptez sur le modèle cible, puis consignez l'usage réel après la réponse. Le comptage préalable est une estimation et peut différer légèrement de l'entrée facturée ; certains outils serveur et blocs d'URL ou de fichiers ne sont pas pris en charge par le compteur. Pour ces cas, appuyez-vous sur l'usage observé des requêtes et gardez une marge de sécurité près du seuil.

Une règle de budget de prompt pour les sous-agents

  1. Mesurez la distribution. Consignez les décomptes de tokens de prompt de Haiku 5.5 par charge de travail, identifiant de modèle et résultat de tâche. Observez combien d'appels se concentrent près de 100k ou le dépassent, plutôt que de regarder seulement la moyenne.
  2. Alertez avant le seuil. Signalez les requêtes proches du seuil dans l'orchestrateur d'agents. Considérez le niveau d'alerte comme votre propre marge opérationnelle, et non comme une règle tarifaire d'Anthropic.
  3. Réduisez la cause. Supprimez les fragments de récupération dupliqués, plafonnez la taille des résultats d'outils ou compactez l'historique périmé lorsque les tests de qualité le permettent. Ne supprimez pas les éléments dont un agent a besoin simplement pour économiser des tokens.
  4. Comparez la longue traîne. Pour les prompts longs inévitables, testez Haiku à son palier supérieur face à une autre route sur les mêmes tâches. Comparez le coût par résultat accepté, la latence et la fréquence de repli, pas seulement les prix catalogue.
  5. Rapprochez de la facture. Valorisez l'entrée, la sortie et les lectures et écritures de cache réelles au palier applicable, puis ajoutez les outils et les relances. Revérifiez les tarifs du fournisseur ou de la plateforme cloud ainsi que les remises contractuelles.

Haiku 5.5 peut rester le meilleur choix au-delà de 100k, mais ce doit être une décision de routage mesurée. Le contrôle essentiel consiste à savoir quelles requêtes franchissent le seuil et pourquoi.

Questions fréquentes des équipes

Le prix plus élevé ne s'applique-t-il qu'aux tokens au-dessus de 100k ?

Non. Anthropic décrit Haiku 5.5 comme tarifé selon la longueur du prompt : un prompt de plus de 100,000 tokens paie les tarifs publiés plus élevés pour cette requête.

Le cache de prompt peut-il maintenir une requête longue dans le palier moins cher ?

Non. Les tokens réutilisés peuvent bénéficier d'un tarif de lecture du cache, mais le contexte mis en cache occupe toujours la longueur du prompt. Comptez le prompt complet lorsque vous vérifiez le seuil.

Une hausse de 30 % due au tokenizer est-elle garantie ?

Non. Anthropic indique environ 30 % de tokens en plus pour le même texte par rapport à Haiku 4.5, selon le contenu. Comptez vos propres prompts sur le modèle cible.

À lire aussi


Vous souhaitez appliquer cela à votre plateforme ? Transmettez vos factures fournisseurs, journaux de passerelle et principaux workflows ; nous cartographierons les coûts et les économies possibles. Demander un audit gratuit →

Retour à finopsllm.com