Quick answer: Una ventana de contexto se anuncia como capacidad: 200.000 tokens, un millón, sitio para lo que haga falta. La capacidad no es la unidad de facturación. Te cobran por lo que envías, y en una...

Pagar dos veces la ventana de contexto

Updated September 1, 2026 · first published September 1, 2026

Una ventana de contexto se anuncia como capacidad: 200.000 tokens, un millón, sitio para lo que haga falta. La capacidad no es la unidad de facturación. Te cobran por lo que envías, y en una conversación de varios turnos vuelves a enviar casi todo en cada turno.

Ese es el segundo pago. Un documento de 30.000 tokens cargado al inicio de una conversación de veinte turnos no son 30.000 tokens de entrada: son unos 600.000.

La cuenta que nadie hace

El coste crece con el cuadrado de la longitud de la conversación, no linealmente. Duplicar los turnos casi cuadruplica los tokens de entrada. Quien modela "coste por mensaje" y multiplica infravalora mucho las sesiones largas.

Suele haber un tercer cargo: muchos proveedores aplican una tarifa premium por encima de cierto umbral de contexto largo. Un adjunto extra puede cruzar esa línea y reencarecer toda la llamada.

Qué medir

Sigue la utilización del contexto: tokens enviados frente a tokens que el modelo realmente necesitaba. Mide tokens de entrada por conversación, no por petición, y vigila el p99.

Tres arreglos, del más barato al menos

Cachea el prefijo estable. Es el cambio de mayor retorno en cualquier producto multiturno.

Recorta el historial a propósito. Resume la parte antigua y descarta los turnos en bruto.

Envía el extracto, no el corpus. Que la ventana quepa entero no es motivo para meterlo entero.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research