DeepSeek Harness: Ziele, Ziel-Runden und die Ralph-Schleife
Updated August 16, 2026 · first published August 16, 2026
Die meisten Kostenüberraschungen bei Agenten entstehen nicht durch den Preis eines Tokens. Sie entstehen dadurch, wie oft der Agent beschlossen hat, es noch einmal zu versuchen. DeepSeek Harness gibt diesem Verhalten ein Vokabular — der erste Schritt, um eine Zahl daran zu heften.
Zug, Schritt, Runde
Drei Einheiten, im Projektglossar sauber getrennt:
| Einheit | Definition | Kostenbedeutung |
|---|---|---|
| Schritt | Eine Modellanfrage plus die von ihr ausgelösten Werkzeugausführungen | Das Abrechnungsatom |
| Zug | Ein Leeren der Eingabe, endend wenn das Modell stoppt oder eine Policy eingreift | Die nutzerseitige Einheit |
| Runde | Eine äußere Policy-Iteration, etwa eine Ziel-Runde oder ein Neuversuch mit frischem Agenten | Der Multiplikator über den Zügen |
Runden sind die Ebene, die selbstgebaute Kostenmodelle meist ganz auslassen. Wenn Ihre Prognose Anfragen zählt und Ihr System in Runden läuft, misst Ihre Prognose das Falsche.
Ziele sind dauerhafte Vorgaben
Ein Ziel ist eine dauerhafte Abschlussvorgabe mit expliziter Phase — aktiv, pausiert, blockiert oder abgeschlossen. Anders als eine Nachricht überdauert es Züge, der Agent trägt also eine stehende Vorgabe mit sich. Jeder für dieses Ziel zugelassene Fortsetzungszyklus ist eine Ziel-Runde, materialisiert als ein zielgetragener Zug.
Die Zulassung wird über eine Zielaktivierung gesteuert: eine prozesslokale Erlaubnis, eine weitere Runde zuzulassen, die entweder scharf oder entschärft ist. Dieses eine Bit ist die Drossel für offene Arbeit.
Eine stehende Vorgabe plus automatische Fortsetzung ist eine Ausgabenermächtigung ohne Obergrenze. Genau deshalb ist dokumentiert, dass das Anlegen und Ändern von Zielen eine direkte menschliche Autorisierung braucht: Jemand muss das Budget für offene Arbeit verantworten.
Die Ralph-Schleife ist bewusster Neustart
Die Ralph-Schleife ist ein Vordergrund-Workflow, der auf ein unveränderliches Ziel hinarbeitet, indem er immer wieder frische Agentensitzungen startet — gebaut auf den Workflow- und Subagenten-Primitiven des Harness. Eine Ralph-Runde ist eine frische Kindsitzung ohne Konversationssaat des Elternteils. Die Kontinuität trägt ein Ralph-Handoff: ein normalisierter, begrenzter, strukturierter Bericht mit Status, Zusammenfassung, Belegen und Blockern.
Die Ökonomie ist hier wirklich interessant und schneidet in beide Richtungen. Sauber neu zu starten heißt, dass jede Runde nur kleine Eingabekosten zahlt, statt eine immer größere Konversation mitzuschleppen — die Kosten pro Runde bleiben flach statt zu klettern. Aber ein frischer Start garantiert keinerlei Fortschritt, und eine Schleife, die billig neu startet, kann sich viel mehr Neustarts leisten.
Der begrenzte Handoff ist die Kontrolle, die das Muster tragfähig macht: Er ist der einzige Kanal zwischen den Runden und deckelt so das Kontextwachstum konstruktiv. Beobachten Sie zwei Zahlen — Runden pro Ziel und ob sich die Blocker-Liste des Handoffs wiederholt. Ein Blocker, der in drei aufeinanderfolgenden Handoffs auftaucht, ist eine Schleife, die nicht konvergieren wird, und jede weitere Runde ist reine Verschwendung.
Kommandos sind keine Werkzeuge
Das lohnt die Trennung, weil es beeinflusst, was Sie messen. Ein menschliches Kommando ist eine slash-präfigierte Anweisung, die über die Kommando-Ebene an menschenzugewandte Adapter geht — Discovery, Parsing, Dispatch, Abbruch und Rendering, verantwortet von UI-Adaptern. Es ist ausdrücklich verschieden von einem Modellwerkzeug. Das Ziel-Kommando ist eines davon.
Praktisch: Ein Mensch, der ein Slash-Kommando tippt, ist nicht das Modell, das Token ausgibt. Rechnen Sie beides getrennt zu, sonst beschuldigen Ihre Sitzungskosten den falschen Akteur.
Vier Kontrollen für offene Arbeit
- Eine maximale Rundenzahl pro Ziel, vor der Zulassung durchgesetzt statt hinterher geprüft.
- Ein kumulatives Token-Budget über alle Runden eines Ziels, nicht pro Runde.
- Konvergenzerkennung am Handoff: wiederkehrende Blocker stoppen die Schleife.
- Explizite menschliche Autorisierung beim Anlegen von Zielen, aufbewahrt als Nachweis, wer die Ausgabe genehmigt hat.
Related
- Was ist DeepSeek Harness? Der Leitfaden
- Subagenten und Delegationstiefe (EN)
- Ausgaben-Leitplanken im Harness (EN)
- Das Sitzungsprotokoll als Kostennachweis (EN)
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →