System One Models und Kostenoptimierung mit Jev
Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026
Im September 2026 angekündigt, bilden System One Models und Jev eine kalibrierungsbasierte Routing-Schicht für LLM-Agenten. Statt nach Aufgabentyp oder mit statischen Regeln zu routen, routet Jev nach Kalibrierung: Ein günstiges Modell (System One) antwortet zuerst; liegt seine Konfidenz unter dem Schwellenwert, wird die Anfrage an ein Premium-Modell eskaliert. Für FinOps heißt das: Sie zahlen nur dann für Reasoning, wenn das günstige Modell die Antwort wirklich nicht kennt.
So funktioniert es
- System One Model (klein, schnell, günstig) erzeugt eine Antwort und einen kalibrierten Konfidenzwert.
- Das Jev-Gateway prüft: Ist die Konfidenz >= Schwellenwert (z. B. 0.9)?
- Falls ja: Die Antwort von System One wird zurückgegeben. Kosten: ~$0.10/1M Tokens.
- Falls nein: Eskalation an ein Premium-Modell (Astra, Opus 5.5 usw.). Kosten: $10-50/1M Tokens.
Kostenvergleich
| Strategie | Ø Kosten/Aufgabe | Genauigkeit |
|---|---|---|
| Immer Astra (maximaler Aufwand) | $1.73 | 50.9 |
| Immer Sol | $0.28 | 44.2 |
| Statisches Routing (leicht→Sol, schwer→Astra) | $0.94 | 48.1 |
| Jev-Kalibrierungs-Routing (Schwellenwert 0.9) | $0.41 | 49.8 |
Daten aus den Jev-Benchmarks auf dem Artificial Analysis Intelligence Index. Kalibrierungs-Routing erreicht nahezu die Genauigkeit von Astra bei 24 % der Kosten.
Warum Kalibrierung statisches Routing schlägt
Statisches Routing stuft 15-20 % der Aufgaben falsch ein (leichte Aufgaben als schwer markiert, schwere als leicht). Kalibrierung korrigiert sich selbst: Das Modell weiß, wann es etwas nicht weiß. Der Schwellenwert von Jev ist einstellbar: Erhöhen Sie ihn für mehr Genauigkeit, senken Sie ihn für geringere Kosten.
FinOps-Umsetzung
- Jev als Gateway bereitstellen: Der gesamte Agenten-Traffic läuft über Jev; System One ist der Standard.
- Schwellenwerte pro Workflow festlegen: Kunden-Chat = 0.95; Hintergrund-Batch = 0.85.
- Eskalationsrate verfolgen: Ziel sind 10-20 % Eskalation. Höher bedeutet, System One ist untertrainiert; niedriger bedeutet, Sie zahlen zu viel.
- Das Premium-Tier budgetieren: Monatliche Eskalationsausgaben deckeln; Alarm bei 80 %.
Integration in bestehende Agenten
Jev umschließt jeden OpenAI-kompatiblen Endpunkt. Bestehende Agenten rufen Jev statt direkt das Modell auf. Keine Codeänderungen an der Agentenlogik: Es ändern sich nur die Basis-URL und der API-Schlüssel.
Fazit
Kalibrierungsbasiertes Routing ist das erste FinOps-Primitiv, das zur Inferenzzeit statt zur Entwurfszeit optimiert. System One + Jev macht aus „Welches Modell?“ von einer statischen Architekturentscheidung eine dynamische Kostenkontrolle pro Anfrage.
Weiterführend
- Jev: Agentenkontrollen und Budgets
- Jev: Entscheidungsökonomie im KI-FinOps
- GPT-6 Astra Kostenmodell
- Modellpreissenkungen und Routing-Budgets
Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →