Como auditar seu gasto em LLM em 30 minutos

A maioria das equipes não sabe como seu orçamento de LLM se decompõe. Os custos se escondem atrás de painéis de provedores que mostram totais mas não atribuição, tipos de tokens que são faturados em taxas diferentes, e padrões de uso que mudam semana a semana. Este guia oferece uma auditoria estruturada que você pode executar em meia hora usando ferramentas que já possui.

Passo 1 - Colete dados de faturamento dos provedores

Exporte os últimos 30 dias de uso de cada provedor de LLM que você usa. Para OpenAI, use a API de Uso ou baixe o CSV do painel. Para Anthropic, puxe dados da API de Faturamento. Para Google, exporte do console de Faturamento em Nuvem. Para modelos autoalojados, puxe logs de requisições do seu servidor de inferência. Armazene tudo em uma pasta. Você precisa de dados brutos, não resumos.

Passo 2 - Normalize as contagens de tokens entre provedores

Cada provedor conta tokens de forma diferente. OpenAI e Anthropic usam seus próprios tokenizadores; Google usa SentencePiece. Para comparar, converta todas as contagens para uma unidade comum. A abordagem mais simples: use o preço por token publicado de cada provedor para calcular o custo por requisição, depois compare custos diretamente em vez de contagens de tokens brutos. Isso evita a incompatibilidade de tokenizadores completamente.

Passo 3 - Divida por entrada, saída, cache e tokens de raciocínio

Os provedores cobram taxas diferentes para tipos de tokens diferentes. Tokens de entrada em cache são normalmente 50% mais baratos na OpenAI e Anthropic. Tokens de raciocínio (em modelos o-series e similares) podem custar 2–4 vezes os tokens de saída padrão. Divida seu gasto em quatro categorias: entrada, saída, entrada em cache e raciocínio. Se seu provedor não expõe essa divisão, estime a partir do tipo de modelo e do padrão de requisição.

Passo 4 - Atribua a equipes e funcionalidades

Mapeie cada chave de API ou projeto para a equipe ou funcionalidade que a possui. Se você não tiver separação no nível de chave, use metadados de requisição - cabeçalhos, tags ou o parâmetro user que a maioria dos provedores suporta. O objetivo é uma tabela: qual equipe gasta quanto em qual funcionalidade. Sem isso, você não pode responsabilizar ninguém pelo custo.

Passo 5 - Identifique os 3 principais impulsionadores de custo

Classifique por gasto total em ordem descendente. Na maioria das organizações, 80% do custo de LLM vem de 3–5 padrões de uso. Impulsionadores comuns: um chatbot com janelas de contexto longas, uma funcionalidade de geração de código que usa modelos caros para todas as requisições, ou um trabalho de enriquecimento em segundo plano que é executado em todo documento sem filtrar. Nomeie-os. Este é o lugar onde você se concentra no esforço de otimização.

Passo 6 - Calcule o custo por tarefa para fluxos principais

Escolha seus 3 fluxos principais. Para cada um, divida o gasto total pelo número de tarefas concluídas. Isso fornece um número de economia unitária que você pode rastrear ao longo do tempo. Um fluxo de suporte ao cliente que custa $0,12 por ticket é gerenciável. Um que custa $1,40 por ticket precisa de atenção. O número absoluto importa menos que a tendência e a comparação entre fluxos.

Passo 7 - Configure alertas para anomalias

Configure alertas em dois níveis: gasto total diário (detecta trabalhos descontrolados) e gasto por fluxo (detecta desvio). A maioria dos provedores suporta alertas de faturamento nativamente. Para alertas entre provedores, canalize seus dados de uso para um painel ou use uma ferramenta como MiMO que agrega entre provedores. Uma regra simples: alerte se algum dia exceder 150% da média móvel de 7 dias.

Lista de verificação de auditoria rápida

PassoFerramenta necessáriaTempo estimadoResultado
1. Coletar dados de faturamentoPainéis ou APIs de provedores5 minCSV/JSON bruto por provedor
2. Normalizar tokensPlanilha ou script5 minTabela de custo por requisição
3. Dividir tipos de tokensAPIs de provedores com divisão de tokens5 minDivisão entrada/saída/cache/raciocínio
4. Atribuir a equipesMapeamento de chaves de API ou metadados5 minMatriz de custo equipe-funcionalidade
5. Identificar impulsionadores principaisClassificação/planilha3 minLista classificada de padrões de custo
6. Custo por tarefaContagem de tarefas de logs de aplicação5 minEconomia unitária por fluxo
7. Configurar alertasAlertas de faturamento + painel2 minDetecção de anomalias ativa

O que fazer depois

Esta auditoria oferece um snapshot. O valor real vem de executá-la regularmente - semanalmente para equipes com alto gasto, mensalmente para todos os outros. Automatize a coleta de dados e transforme a métrica de custo por tarefa em uma métrica de produto de primeira classe. Se você deseja ajuda para construir isso em um processo contínuo, MiMO fornece painéis entre provedores e atribuição automatizada prontos para uso.

Relacionado


Quer isso aplicado ao seu próprio gasto em LLM? FinOps LLM executa uma auditoria gratuita de seus custos de IA e mostra onde estão as economias. Agende auditoria gratuita →

Voltar à pesquisa