System One Models y optimización de costos con Jev
Actualizado September 27, 2026 · publicado originalmente September 27, 2026
Anunciados en septiembre de 2026, System One Models y Jev forman una capa de enrutamiento basada en calibración para agentes de LLM. En lugar de enrutar por tipo de tarea o con reglas estáticas, Jev enruta por calibración: primero responde un modelo barato (System One); si su confianza está por debajo del umbral, la solicitud escala a un modelo premium. Para FinOps, esto significa pagar por razonamiento solo cuando el modelo barato realmente no sabe.
Cómo funciona
- System One Model (pequeño, rápido, barato) genera una respuesta y una puntuación de confianza calibrada.
- El gateway de Jev comprueba: ¿la confianza es >= umbral (p. ej., 0.9)?
- Si es así: devuelve la respuesta de System One. Costo: ~$0.10/1M tokens.
- Si no: escala a un modelo premium (Astra, Opus 5.5, etc.). Costo: $10-50/1M tokens.
Comparación de costos
| Estrategia | Costo prom./tarea | Precisión |
|---|---|---|
| Siempre Astra (máximo esfuerzo) | $1.73 | 50.9 |
| Siempre Sol | $0.28 | 44.2 |
| Enrutamiento estático (fácil→Sol, difícil→Astra) | $0.94 | 48.1 |
| Enrutamiento por calibración de Jev (umbral 0.9) | $0.41 | 49.8 |
Datos de los benchmarks de Jev sobre el Artificial Analysis Intelligence Index. El enrutamiento por calibración logra una precisión casi igual a la de Astra con el 24 % del costo.
Por qué la calibración supera al enrutamiento estático
El enrutamiento estático clasifica mal entre el 15 y el 20 % de las tareas (tareas fáciles marcadas como difíciles y viceversa). La calibración se autocorrige: el modelo sabe cuándo no sabe. El umbral de Jev es ajustable: súbalo para mayor precisión, bájelo para menor costo.
Implementación de FinOps
- Despliegue Jev como gateway: todo el tráfico de agentes pasa por Jev; System One es el predeterminado.
- Defina umbrales por flujo de trabajo: chat de cara al cliente = 0.95; lotes en segundo plano = 0.85.
- Mida la tasa de escalada: el objetivo es una escalada del 10-20 %. Más alta indica que System One está subentrenado; más baja, que está pagando de más.
- Presupueste el nivel premium: limite el gasto mensual en escaladas y alerte al 80 %.
Integración con agentes existentes
Jev envuelve cualquier endpoint compatible con OpenAI. Los agentes existentes llaman a Jev en lugar de llamar directamente al modelo. No hay cambios de código en la lógica del agente: solo cambian la URL base y la clave de API.
Conclusión
El enrutamiento por calibración es la primera primitiva de FinOps que optimiza en tiempo de inferencia, no en tiempo de diseño. System One + Jev convierte «¿qué modelo?» de una decisión de arquitectura estática en un control de costos dinámico, solicitud por solicitud.
Relacionado
- Controles y presupuestos de agentes con Jev
- Economía de decisiones de FinOps de IA con Jev
- Modelo de costo de GPT-6 Astra
- Recortes de precios de modelos y presupuestos de enrutamiento
¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →