Quick answer: Une fenêtre de contexte est annoncée comme une capacité : 200 000 tokens, un million, de la place pour tout. La capacité n’est pas l’unité de facturation. On vous facture ce que vous envoyez, et dans...

Payer deux fois la fenêtre de contexte

Updated September 1, 2026 · first published September 1, 2026

Une fenêtre de contexte est annoncée comme une capacité : 200 000 tokens, un million, de la place pour tout. La capacité n’est pas l’unité de facturation. On vous facture ce que vous envoyez, et dans une conversation multi-tours vous renvoyez presque tout à chaque tour.

C’est le second paiement. Un document de 30 000 tokens chargé au début d’une conversation de vingt tours, ce n’est pas 30 000 tokens d’entrée : c’est près de 600 000.

Le calcul que personne ne fait

Le coût croît avec le carré de la longueur de la conversation, pas linéairement. Doubler les tours quadruple à peu près les tokens d’entrée. Modéliser un « coût par message » et multiplier sous-estime lourdement les sessions longues.

Un troisième frais s’ajoute souvent : beaucoup de fournisseurs facturent au-delà d’un seuil de contexte long à un tarif majoré. Une pièce jointe de plus peut franchir cette ligne et retarifer tout l’appel.

Quoi mesurer

Suivez le taux d’utilisation du contexte : tokens envoyés contre tokens réellement nécessaires. Mesurez les tokens d’entrée par conversation, pas par requête, et surveillez le p99.

Trois correctifs, du moins cher au plus

Mettez en cache le préfixe stable — le meilleur rendement pour tout produit multi-tours.

Élaguez l’historique délibérément : résumez le début et jetez les tours bruts.

Envoyez l’extrait, pas le corpus. Que la fenêtre puisse contenir un document entier n’est pas une raison de l’y mettre.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research