Gasto de LLM fuera de producción
Updated September 1, 2026 · first published September 1, 2026
Toda revisión FinOps empieza por el tráfico de producción, porque es lo que tiene panel. Luego alguien desglosa por entorno y descubre que una parte notable de la factura — a menudo de dos dígitos en porcentaje — nunca tocó a un cliente.
De dónde sale
CI: cada pull request que ejecuta una suite de evaluación llama al modelo, miles de veces al día y en el modelo más caro. Desarrollo local: iterar un prompt son decenas de llamadas por hora, con clave compartida y sin etiquetar. Staging y demos: configurados igual que producción, con el modelo caro y sin caché. Reintentos y bucles descontrolados en pruebas, que nadie vigila.
Primero la atribución
El cambio que se paga solo es una clave de API por entorno. Cuesta una tarde y convierte una partida inexplicable en cuatro etiquetadas. Etiqueta el entorno en cada petición y, en CI, el repositorio y el workflow.
Después llegan tres cosas solas: fuera de producción casi siempre basta un modelo más barato; la caché rinde más que en ningún sitio, porque CI repite prompts casi idénticos; y los topes duros de gasto ahí sí son seguros — un entorno de pruebas con tope rompe un build, uno de producción rompe un cliente.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →