O que custam guardrails e moderação
Updated September 1, 2026 · first published September 1, 2026
Uma funcionalidade LLM em produção raramente faz uma só chamada. Faz a que desenhou e depois as que acrescentou por segurança: classificador de entrada, verificação de saída, juiz de política, às vezes um segundo modelo a avaliar o primeiro. Tudo isso é inferência, e inferência é faturada.
O multiplicador é maior do que parece
A moderação de entrada lê toda a entrada, a de saída lê toda a resposta. Um juiz lê as duas, mais o contexto recuperado e uma grelha — a chamada do juiz fica maior do que a chamada julgada.
Onde a despesa se acumula
Três padrões: julgar com um modelo de fronteira por comodidade (a classificação é precisamente onde um modelo pequeno chega, e costuma ser a maior poupança disponível); verificar em cada turno, revarrendo histórico já aprovado; e guardrails em tráfego interno, que herda a pilha de segurança pública sem precisar dela.
Orçamente como uma linha
Não se trata de retirar os controlos, mas de ver que podem ser 30–50% do custo de inferência sem constar do plano. Marque as chamadas de guardrail em separado na telemetria.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →