Atribución de costes de LLM
La atribución de costes de LLM es el puente entre las facturas del proveedor y las decisiones operacionales. Los proveedores facturan por cuenta, modelo, clase de token y a veces por región o funcionalidad. Las empresas necesitan entender el gasto por equipo, producto, cliente, flujo de trabajo y unidad de valor. La capa de atribución conecta esas dos vistas sin perder la conciliación con la factura bruta.
La clave es etiquetar las solicitudes antes de que lleguen al proveedor o gateway. Los registros creados después del hecho generalmente son incompletos. Como mínimo, cada llamada LLM en producción debe llevar un nombre de endpoint estable, entorno, propietario del equipo, superficie del producto, clase de carga de trabajo e ID de correlación. Donde los contratos lo permitan, añade ID de inquilino o cliente. Para flujos de trabajo de agentes, etiqueta cada llamada de herramienta o paso del modelo por separado.
El recuento de solicitudes no es atribución
Asignar gasto por recuento de solicitudes es casi siempre incorrecto. Una solicitud de razonamiento de contexto largo puede costar más que cientos de llamadas de clasificación corta. La atribución necesita clases de token y precios de modelo. También necesita datos de reintentos y fallbacks, porque una respuesta "exitosa" puede ocultar tres llamadas fallidas anteriores.
Dimensiones recomendadas
- Proveedor, modelo y versión del modelo donde esté disponible.
- Clases de token de entrada, salida, escritura de caché, lectura de caché y razonamiento.
- Equipo, producto, funcionalidad, endpoint y entorno.
- Clase de carga de trabajo: ruta de usuario en tiempo real, trabajo en background, evaluación, enriquecimiento, paso de agente, flujo de trabajo de soporte o tarea de análisis.
- Atribución de cliente o inquilino cuando lo permitan los límites de privacidad y contrato.
Conciliación de factura
La atribución debe conciliar de vuelta con la factura del proveedor. Espera pequeñas diferencias por redondeo, líneas de factura demoradas y descuentos específicos del proveedor, pero grandes brechas significan que el pipeline de registros está perdiendo tráfico o usando tablas de precios obsoletas. La vista de finanzas debe mostrar tanto gasto asignado como no asignado para que los problemas de calidad de datos sean visibles.
De showback a acción
El primer resultado debe ser showback: qué equipos y superficies de producto están impulsando el gasto, y qué cargas de trabajo cambiaron desde el mes pasado. Una vez que los equipos confíen en esos datos, úsalos para clasificar el trabajo de optimización. La atribución es valiosa porque señala directamente a los propietarios que pueden aprobar enrutamiento, caché o cambios de prompts.
Relacionado
- Atribución de costes de OpenAI - patrones de atribución específicos de OpenAI.
- Chargeback y showback de LLM - trasladar costes a los propietarios.
- ¿Qué es FinOps de LLM? - la disciplina operacional completa.
¿Deseas aplicar esto a tu propio gasto en LLM? FinOps LLM realiza una auditoría gratuita de tus costes en IA y muestra dónde están los ahorros. Solicita tu auditoría gratuita →