Atribuição de custos de LLM
A atribuição de custos de LLM é a ponte entre as faturas do provedor e as decisões operacionais. Os provedores cobram por conta, modelo, classe de token e às vezes por região ou funcionalidade. As empresas precisam entender o gasto por equipe, produto, cliente, fluxo de trabalho e unidade de valor. A camada de atribuição conecta essas duas visualizações sem perder a reconciliação com a fatura bruta.
A chave é etiquetar as requisições antes que cheguem ao provedor ou gateway. Os registros criados após o fato geralmente são incompletos. No mínimo, cada chamada LLM em produção deve incluir um nome de endpoint estável, ambiente, proprietário da equipe, superfície do produto, classe de carga de trabalho e ID de correlação. Quando os contratos permitem, adicione ID de inquilino ou cliente. Para fluxos de trabalho de agentes, etiquete cada chamada de ferramenta ou passo do modelo separadamente.
Contagem de requisições não é atribuição
Alocar gasto por contagem de requisições é quase sempre incorreto. Uma requisição de raciocínio com contexto longo pode custar mais do que centenas de chamadas de classificação curta. A atribuição precisa de classes de token e preços de modelo. Também precisa de dados de tentativas novamente e fallbacks, porque uma resposta "bem-sucedida" pode ocultar três chamadas falhadas anteriores.
Dimensões recomendadas
- Provedor, modelo e versão do modelo quando disponível.
- Classes de token de entrada, saída, escrita de cache, leitura de cache e raciocínio.
- Equipe, produto, funcionalidade, endpoint e ambiente.
- Classe de carga de trabalho: caminho de usuário em tempo real, trabalho em segundo plano, avaliação, enriquecimento, passo de agente, fluxo de trabalho de suporte ou tarefa de análise.
- Atribuição de cliente ou inquilino quando permitido pelos limites de privacidade e contrato.
Reconciliação de fatura
A atribuição deve reconciliar de volta com a fatura do provedor. Espere pequenas diferenças por arredondamento, linhas de fatura atrasadas e descontos específicos do provedor, mas grandes lacunas significam que o pipeline de registro está perdendo tráfego ou usando tabelas de preços obsoletas. A visualização de finanças deve mostrar tanto gasto atribuído quanto não atribuído para que os problemas de qualidade de dados fiquem visíveis.
De showback para ação
A primeira saída deve ser showback: quais equipes e superfícies de produto estão impulsionando o gasto, e quais cargas de trabalho mudaram desde o mês passado. Uma vez que as equipes confiem nesses dados, use-os para classificar o trabalho de otimização. A atribuição é valiosa porque aponta diretamente para os proprietários que podem aprovar roteamento, cache ou mudanças de prompt.
Relacionado
- Atribuição de custos de OpenAI - padrões de atribuição específicos do OpenAI.
- Chargeback e showback de LLM - transferindo custos para proprietários.
- O que é FinOps de LLM? - a disciplina operacional completa.
Deseja aplicar isto ao seu próprio gasto em LLM? O FinOps LLM realiza uma auditoria gratuita de seus custos de IA e mostra onde estão as economias. Agende sua auditoria gratuita →