Payer deux fois la fenêtre de contexte
Updated September 1, 2026 · first published September 1, 2026
Une fenêtre de contexte est annoncée comme une capacité : 200 000 tokens, un million, de la place pour tout. La capacité n’est pas l’unité de facturation. On vous facture ce que vous envoyez, et dans une conversation multi-tours vous renvoyez presque tout à chaque tour.
C’est le second paiement. Un document de 30 000 tokens chargé au début d’une conversation de vingt tours, ce n’est pas 30 000 tokens d’entrée : c’est près de 600 000.
Le calcul que personne ne fait
Le coût croît avec le carré de la longueur de la conversation, pas linéairement. Doubler les tours quadruple à peu près les tokens d’entrée. Modéliser un « coût par message » et multiplier sous-estime lourdement les sessions longues.
Un troisième frais s’ajoute souvent : beaucoup de fournisseurs facturent au-delà d’un seuil de contexte long à un tarif majoré. Une pièce jointe de plus peut franchir cette ligne et retarifer tout l’appel.
Quoi mesurer
Suivez le taux d’utilisation du contexte : tokens envoyés contre tokens réellement nécessaires. Mesurez les tokens d’entrée par conversation, pas par requête, et surveillez le p99.
Trois correctifs, du moins cher au plus
Mettez en cache le préfixe stable — le meilleur rendement pour tout produit multi-tours.
Élaguez l’historique délibérément : résumez le début et jetez les tours bruts.
Envoyez l’extrait, pas le corpus. Que la fenêtre puisse contenir un document entier n’est pas une raison de l’y mettre.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →