Cómo auditar tu gasto en LLM en 30 minutos

La mayoría de los equipos no saben cómo se desglosa su presupuesto de LLM. Los costes se ocultan detrás de paneles de proveedores que muestran totales pero no atribución, tipos de tokens que se facturan a tarifas distintas, y patrones de uso que cambian semana a semana. Esta guía te ofrece una auditoría estructurada que puedes ejecutar en media hora con herramientas que ya tienes.

Paso 1 - Recopila datos de facturación de los proveedores

Exporta los últimos 30 días de uso de cada proveedor de LLM que utilizas. Para OpenAI, usa la API de Usage o descarga el CSV desde el panel. Para Anthropic, extrae los datos de la API de Billing. Para Google, exporta desde la consola de Cloud Billing. Para modelos autoalojados, extrae los logs de solicitudes de tu servidor de inferencia. Guarda todo en una sola carpeta. Necesitas datos en bruto, no resúmenes.

Paso 2 - Normaliza los recuentos de tokens entre proveedores

Cada proveedor cuenta tokens de forma distinta. OpenAI y Anthropic usan sus propios tokenizadores; Google usa SentencePiece. Para comparar, convierte todas las cuentas a una unidad común. El enfoque más sencillo: usa el precio por token publicado de cada proveedor para calcular el coste por solicitud y luego compara costes directamente en lugar de recuentos de tokens brutos. Esto evita por completo la discrepancia de tokenizadores.

Paso 3 - Divide por tokens de entrada, salida, caché y razonamiento

Los proveedores cobran tarifas distintas según el tipo de token. Los tokens de entrada en caché suelen ser un 50% más baratos en OpenAI y Anthropic. Los tokens de razonamiento (en series o y modelos similares) pueden costar entre 2 y 4 veces los tokens de salida estándar. Divide tu gasto en cuatro categorías: entrada, salida, entrada en caché y razonamiento. Si tu proveedor no expone esta división, estímala a partir del tipo de modelo y el patrón de solicitud.

Paso 4 - Atribuye a equipos y funcionalidades

Asigna cada clave API o proyecto al equipo o funcionalidad que lo posee. Si no tienes separación a nivel de clave, usa metadatos de solicitud - cabeceras, etiquetas o el parámetro user que la mayoría de los proveedores soportan. El objetivo es una tabla: qué equipo gasta cuánto en qué funcionalidad. Sin esto, no puedes hacer a nadie responsable del coste.

Paso 5 - Identifica los 3 principales impulsores de coste

Ordena por gasto total descendente. En la mayoría de las organizaciones, el 80% del coste de LLM proviene de 3 a 5 patrones de uso. Impulsores comunes: un chatbot con ventanas de contexto largas, una funcionalidad de generación de código que usa modelos caros para todas las solicitudes, o un trabajo de enriquecimiento en segundo plano que se ejecuta en cada documento sin filtrar. Nómbralos. Aquí es donde enfocas el esfuerzo de optimización.

Paso 6 - Calcula el coste por tarea para flujos clave

Elige tus 3 flujos principales. Para cada uno, divide el gasto total por el número de tareas completadas. Esto te da un número de economía unitaria que puedes seguir a lo largo del tiempo. Un flujo de soporte al cliente que cuesta $0.12 por ticket es manejable. Uno que cuesta $1.40 por ticket necesita atención. El número absoluto importa menos que la tendencia y la comparación entre flujos.

Paso 7 - Configura alertas para anomalías

Configura alertas en dos niveles: gasto diario total (detecta trabajos descontrolados) y gasto por flujo (detecta desviación). La mayoría de los proveedores soportan alertas de facturación de forma nativa. Para alertas multi-proveedor, canaliza tus datos de uso a un panel o usa una herramienta como MiMO que agrega entre proveedores. Una regla simple: alerta si algún día supera el 150% de la media móvil de 7 días.

Lista de verificación de auditoría rápida

PasoHerramienta necesariaTiempo estimadoResultado
1. Recopilar datos de facturaciónPaneles o APIs de proveedores5 minCSV/JSON en bruto por proveedor
2. Normalizar tokensHoja de cálculo o script5 minTabla de coste por solicitud
3. Dividir tipos de tokensAPIs de proveedores con desglose de tokens5 minDivisión entrada/salida/caché/razonamiento
4. Atribuir a equiposMapeo de claves API o metadatos5 minMatriz de costes equipo-funcionalidad
5. Identificar impulsores principalesOrdenación/hoja de cálculo3 minLista ordenada de patrones de coste
6. Coste por tareaRecuento de tareas de logs de aplicación5 minEconomía unitaria por flujo
7. Configurar alertasAlertas de facturación + panel2 minDetección de anomalías activa

Qué hacer después

Esta auditoría te da una instantánea. El valor real viene de ejecutarla regularmente - semanalmente para equipos con alto gasto, mensualmente para todos los demás. Automatiza la recopilación de datos y convierte la métrica de coste por tarea en una métrica de producto de primera clase. Si quieres ayuda para construir esto en un proceso continuo, MiMO proporciona paneles multi-proveedor y atribución automatizada listos para usar.

Relacionado


¿Quieres esto aplicado a tu propio gasto en LLM? FinOps LLM ejecuta una auditoría gratuita de tus costes de IA y muestra dónde están los ahorros. Reserva auditoría gratuita →

Volver a investigación