System One Models e otimização de custos com Jev
Atualizado September 27, 2026 · publicado originalmente September 27, 2026
Anunciados em setembro de 2026, o System One Models e o Jev formam uma camada de roteamento baseada em calibração para agentes de LLM. Em vez de rotear por tipo de tarefa ou por regras estáticas, o Jev roteia por calibração: um modelo barato (System One) responde primeiro; se a confiança dele estiver abaixo do limite, a requisição é escalada para um modelo premium. Para FinOps, isso significa pagar por raciocínio apenas quando o modelo barato realmente não sabe.
Como funciona
- O System One Model (pequeno, rápido, barato) gera uma resposta e uma pontuação de confiança calibrada.
- O gateway do Jev verifica: a confiança é >= ao limite (p. ex., 0.9)?
- Se sim: retorna a resposta do System One. Custo: ~$0.10/1M tokens.
- Se não: escala para um modelo premium (Astra, Opus 5.5 etc.). Custo: $10-50/1M tokens.
Comparação de custos
| Estratégia | Custo médio/tarefa | Precisão |
|---|---|---|
| Sempre Astra (esforço máximo) | $1.73 | 50.9 |
| Sempre Sol | $0.28 | 44.2 |
| Roteamento estático (fácil→Sol, difícil→Astra) | $0.94 | 48.1 |
| Roteamento por calibração do Jev (limite 0.9) | $0.41 | 49.8 |
Dados dos benchmarks do Jev no Artificial Analysis Intelligence Index. O roteamento por calibração alcança precisão quase igual à do Astra com 24% do custo.
Por que a calibração supera o roteamento estático
O roteamento estático classifica errado 15-20% das tarefas (tarefas fáceis marcadas como difíceis e vice-versa). A calibração se autocorrige: o modelo sabe quando não sabe. O limite do Jev é ajustável: aumente-o para mais precisão, reduza-o para menor custo.
Implementação de FinOps
- Implante o Jev como gateway: todo o tráfego dos agentes passa pelo Jev; o System One é o padrão.
- Defina limites por fluxo de trabalho: chat voltado ao cliente = 0.95; lote em segundo plano = 0.85.
- Acompanhe a taxa de escalada: a meta é 10-20% de escalada. Mais alta indica que o System One está subtreinado; mais baixa, que você está pagando a mais.
- Orce o nível premium: limite o gasto mensal com escaladas; alerte aos 80%.
Integração com agentes existentes
O Jev envolve qualquer endpoint compatível com a OpenAI. Os agentes existentes chamam o Jev em vez de chamar o modelo diretamente. Nenhuma mudança de código na lógica do agente: apenas a URL base e a chave de API mudam.
Conclusão
O roteamento por calibração é o primeiro primitivo de FinOps que otimiza em tempo de inferência, e não em tempo de projeto. System One + Jev transforma “qual modelo?” de uma decisão de arquitetura estática em um controle de custos dinâmico, requisição a requisição.
Artigos relacionados
- Controles e orçamentos de agentes com o Jev
- Economia de decisão de FinOps de IA com o Jev
- Modelo de custo do GPT-6 Astra
- Cortes de preço de modelos e orçamentos de roteamento
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →