Quick answer: Die meisten Kostenüberraschungen bei Agenten entstehen nicht durch den Preis eines Tokens. Sie entstehen dadurch, wie oft der Agent beschlossen hat, es noch einmal zu versuchen. DeepSeek Harness gibt...

DeepSeek Harness: Ziele, Ziel-Runden und die Ralph-Schleife

Updated August 16, 2026 · first published August 16, 2026

Die meisten Kostenüberraschungen bei Agenten entstehen nicht durch den Preis eines Tokens. Sie entstehen dadurch, wie oft der Agent beschlossen hat, es noch einmal zu versuchen. DeepSeek Harness gibt diesem Verhalten ein Vokabular — der erste Schritt, um eine Zahl daran zu heften.

Zug, Schritt, Runde

Drei Einheiten, im Projektglossar sauber getrennt:

EinheitDefinitionKostenbedeutung
SchrittEine Modellanfrage plus die von ihr ausgelösten WerkzeugausführungenDas Abrechnungsatom
ZugEin Leeren der Eingabe, endend wenn das Modell stoppt oder eine Policy eingreiftDie nutzerseitige Einheit
RundeEine äußere Policy-Iteration, etwa eine Ziel-Runde oder ein Neuversuch mit frischem AgentenDer Multiplikator über den Zügen

Runden sind die Ebene, die selbstgebaute Kostenmodelle meist ganz auslassen. Wenn Ihre Prognose Anfragen zählt und Ihr System in Runden läuft, misst Ihre Prognose das Falsche.

Ziele sind dauerhafte Vorgaben

Ein Ziel ist eine dauerhafte Abschlussvorgabe mit expliziter Phase — aktiv, pausiert, blockiert oder abgeschlossen. Anders als eine Nachricht überdauert es Züge, der Agent trägt also eine stehende Vorgabe mit sich. Jeder für dieses Ziel zugelassene Fortsetzungszyklus ist eine Ziel-Runde, materialisiert als ein zielgetragener Zug.

Die Zulassung wird über eine Zielaktivierung gesteuert: eine prozesslokale Erlaubnis, eine weitere Runde zuzulassen, die entweder scharf oder entschärft ist. Dieses eine Bit ist die Drossel für offene Arbeit.

Eine stehende Vorgabe plus automatische Fortsetzung ist eine Ausgabenermächtigung ohne Obergrenze. Genau deshalb ist dokumentiert, dass das Anlegen und Ändern von Zielen eine direkte menschliche Autorisierung braucht: Jemand muss das Budget für offene Arbeit verantworten.

Die Ralph-Schleife ist bewusster Neustart

Die Ralph-Schleife ist ein Vordergrund-Workflow, der auf ein unveränderliches Ziel hinarbeitet, indem er immer wieder frische Agentensitzungen startet — gebaut auf den Workflow- und Subagenten-Primitiven des Harness. Eine Ralph-Runde ist eine frische Kindsitzung ohne Konversationssaat des Elternteils. Die Kontinuität trägt ein Ralph-Handoff: ein normalisierter, begrenzter, strukturierter Bericht mit Status, Zusammenfassung, Belegen und Blockern.

Die Ökonomie ist hier wirklich interessant und schneidet in beide Richtungen. Sauber neu zu starten heißt, dass jede Runde nur kleine Eingabekosten zahlt, statt eine immer größere Konversation mitzuschleppen — die Kosten pro Runde bleiben flach statt zu klettern. Aber ein frischer Start garantiert keinerlei Fortschritt, und eine Schleife, die billig neu startet, kann sich viel mehr Neustarts leisten.

Der begrenzte Handoff ist die Kontrolle, die das Muster tragfähig macht: Er ist der einzige Kanal zwischen den Runden und deckelt so das Kontextwachstum konstruktiv. Beobachten Sie zwei Zahlen — Runden pro Ziel und ob sich die Blocker-Liste des Handoffs wiederholt. Ein Blocker, der in drei aufeinanderfolgenden Handoffs auftaucht, ist eine Schleife, die nicht konvergieren wird, und jede weitere Runde ist reine Verschwendung.

Kommandos sind keine Werkzeuge

Das lohnt die Trennung, weil es beeinflusst, was Sie messen. Ein menschliches Kommando ist eine slash-präfigierte Anweisung, die über die Kommando-Ebene an menschenzugewandte Adapter geht — Discovery, Parsing, Dispatch, Abbruch und Rendering, verantwortet von UI-Adaptern. Es ist ausdrücklich verschieden von einem Modellwerkzeug. Das Ziel-Kommando ist eines davon.

Praktisch: Ein Mensch, der ein Slash-Kommando tippt, ist nicht das Modell, das Token ausgibt. Rechnen Sie beides getrennt zu, sonst beschuldigen Ihre Sitzungskosten den falschen Akteur.

Vier Kontrollen für offene Arbeit

  1. Eine maximale Rundenzahl pro Ziel, vor der Zulassung durchgesetzt statt hinterher geprüft.
  2. Ein kumulatives Token-Budget über alle Runden eines Ziels, nicht pro Runde.
  3. Konvergenzerkennung am Handoff: wiederkehrende Blocker stoppen die Schleife.
  4. Explizite menschliche Autorisierung beim Anlegen von Zielen, aufbewahrt als Nachweis, wer die Ausgabe genehmigt hat.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research