Pagar dos veces la ventana de contexto
Updated September 1, 2026 · first published September 1, 2026
Una ventana de contexto se anuncia como capacidad: 200.000 tokens, un millón, sitio para lo que haga falta. La capacidad no es la unidad de facturación. Te cobran por lo que envías, y en una conversación de varios turnos vuelves a enviar casi todo en cada turno.
Ese es el segundo pago. Un documento de 30.000 tokens cargado al inicio de una conversación de veinte turnos no son 30.000 tokens de entrada: son unos 600.000.
La cuenta que nadie hace
El coste crece con el cuadrado de la longitud de la conversación, no linealmente. Duplicar los turnos casi cuadruplica los tokens de entrada. Quien modela "coste por mensaje" y multiplica infravalora mucho las sesiones largas.
Suele haber un tercer cargo: muchos proveedores aplican una tarifa premium por encima de cierto umbral de contexto largo. Un adjunto extra puede cruzar esa línea y reencarecer toda la llamada.
Qué medir
Sigue la utilización del contexto: tokens enviados frente a tokens que el modelo realmente necesitaba. Mide tokens de entrada por conversación, no por petición, y vigila el p99.
Tres arreglos, del más barato al menos
Cachea el prefijo estable. Es el cambio de mayor retorno en cualquier producto multiturno.
Recorta el historial a propósito. Resume la parte antigua y descarta los turnos en bruto.
Envía el extracto, no el corpus. Que la ventana quepa entero no es motivo para meterlo entero.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →