System One 모델과 Jev 비용 최적화
업데이트 September 27, 2026 · 최초 게시 September 27, 2026
2026년 9월에 발표된 System One 모델과 Jev는 LLM 에이전트를 위한 보정 기반 라우팅 계층을 구성합니다. 작업 유형이나 정적 규칙으로 라우팅하는 대신, Jev는 보정으로 라우팅합니다. 저렴한 모델(System One)이 먼저 답하고, 신뢰도가 임계값보다 낮으면 요청이 프리미엄 모델로 에스컬레이션됩니다. FinOps 관점에서 이는 저렴한 모델이 정말로 모를 때만 추론에 비용을 지불한다는 뜻입니다.
작동 방식
- System One 모델(작고 빠르며 저렴함)이 답변과 보정된 신뢰도 점수를 생성합니다.
- Jev 게이트웨이가 확인합니다: 신뢰도가 임계값(예: 0.9) 이상인가?
- 그렇다면: System One의 답변을 반환합니다. 비용: 약 $0.10/1M 토큰.
- 그렇지 않다면: 프리미엄 모델(Astra, Opus 5.5 등)로 에스컬레이션합니다. 비용: $10-50/1M 토큰.
비용 비교
| 전략 | 작업당 평균 비용 | 정확도 |
|---|---|---|
| 항상 Astra(최대 노력) | $1.73 | 50.9 |
| 항상 Sol | $0.28 | 44.2 |
| 정적 라우팅(쉬움→Sol, 어려움→Astra) | $0.94 | 48.1 |
| Jev 보정 라우팅(임계값 0.9) | $0.41 | 49.8 |
데이터 출처는 Artificial Analysis Intelligence Index에서 실행한 Jev 벤치마크입니다. 보정 라우팅은 Astra에 가까운 정확도를 비용의 24%로 달성합니다.
보정이 정적 라우팅을 이기는 이유
정적 라우팅은 작업의 15-20%를 잘못 분류합니다(쉬운 작업은 어렵다고, 어려운 작업은 쉽다고 표시). 보정은 스스로 교정합니다. 모델이 자신이 모르는 때를 알기 때문입니다. Jev의 임계값은 조정할 수 있습니다. 정확도를 높이려면 올리고, 비용을 낮추려면 내리세요.
FinOps 구현
- Jev를 게이트웨이로 배포: 모든 에이전트 트래픽이 Jev를 거치며, System One이 기본값입니다.
- 워크플로우별로 임계값 설정: 고객 대면 채팅 = 0.95, 백그라운드 배치 = 0.85.
- 에스컬레이션 비율 추적: 목표는 10-20% 에스컬레이션입니다. 더 높으면 System One이 충분히 학습되지 않은 것이고, 더 낮으면 과다 지불하고 있는 것입니다.
- 프리미엄 티어 예산 책정: 월간 에스컬레이션 지출에 상한을 두고, 80%에 도달하면 경고하세요.
기존 에이전트와의 통합
Jev는 모든 OpenAI 호환 엔드포인트를 감쌉니다. 기존 에이전트는 모델을 직접 호출하는 대신 Jev를 호출합니다. 에이전트 로직을 바꿀 필요는 없고, 기본 URL과 API 키만 바뀝니다.
결론
보정 기반 라우팅은 설계 시점이 아니라 추론 시점에 최적화하는 최초의 FinOps 기본 요소입니다. System One과 Jev는 "어떤 모델을 쓸까?"라는 질문을 정적인 아키텍처 결정에서 요청마다 움직이는 동적 비용 통제로 바꿉니다.
관련 글
이 내용을 현재 스택에 적용하고 싶으신가요? 공급업체 청구서, 게이트웨이 로그, 주요 워크플로를 가져오시면 비용 요인과 절감 경로를 정리해드립니다. 무료 감사 예약 →