Claude-Code-Token-Verbrauch prüfen und senken
Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026
Mit /usage sehen Sie, was Claude Code ausgibt, mit /context, was das Fenster füllt. Um weniger auszugeben, halten Sie den Kontext klein: zwischen Aufgaben leeren, die Effort-Stufe senken und ausführliche Ausgaben aus der Hauptkonversation heraushalten. Der Kontext zählt mehr als alles andere, weil Claude Code mit jeder Anfrage die gesamte Konversation erneut sendet. In unseren eigenen Logs bestanden 96 % der Tokens darin, dass der Agent seinen Kontext erneut las.
Diese Seite behandelt die Befehle, die Ihren Verbrauch anzeigen, die Einstellungen mit der größten Wirkung und wohin die Tokens tatsächlich gehen. Die Tipps stammen aus der Kostendokumentation von Anthropic. Die Zahlen stammen aus unseren eigenen Claude-Code-Logs und veröffentlichten Benchmarks.
Wie prüfe ich den Token-Verbrauch von Claude Code?
/usage: zeigt Token-Zahlen und geschätzte Kosten der aktuellen Sitzung, eine Zeile zum Prompt-Cache und bei den Plänen Pro, Max, Team und Enterprise Ihre Nutzungsbalken. Es schlüsselt auch auf, was Ihren Plan verbraucht: Skills, Subagenten, Plugins, MCP-Server und geplante Schleifen, über die letzten 24 Stunden oder 7 Tage./context: zeigt, was gerade das Kontextfenster belegt, mit Hinweisen, was sich kürzen lässt./insights: erstellt einen HTML-Bericht über Ihre letzten Sitzungen und darüber, wo Sie Zeit und Tokens verlieren.- Die Statuszeile: Ein Skript kann bei jedem Prompt Kosten, genutzten Kontext und Ihre 5-Stunden- und 7-Tage-Prozentwerte anzeigen. Siehe die Dokumentation zur Statuszeile.
- claude.ai Settings > Usage: Plan-Limits und Ausgaben von Nutzungs-Credits, einschließlich Nutzung von anderen Geräten.
In einem Pro- oder Max-Plan ist der Dollarbetrag in /usage das, was die Sitzung zu API-Listenpreisen gekostet hätte, nicht das, was Sie zahlen. Er ist dennoch das beste Einzelmaß dafür, wie schwer eine Sitzung ist.
Wohin gehen die Tokens von Claude Code tatsächlich?
Größtenteils in das erneute Lesen von Kontext. Jede Anfrage trägt die vollständige Konversation, und jeder Tool-Aufruf sendet eine weitere Anfrage mit den Ergebnissen. In unseren Claude-Code-Logs machten 7,0 Milliarden Cache-Read-Tokens 96 % aller Tokens und die Hälfte einer API-äquivalenten Rechnung von $6,986 aus. Output-Tokens, der Teil, den Sie sehen, lagen unter 1 % des Volumens.
Deshalb ist eine einzeilige Frage in einer den ganzen Tag offenen Sitzung nicht billig. Sie zieht den ganzen Tag mit sich. Unsere Seite zu Tokens pro Plan enthält die vollständige Aufschlüsselung: etwa 1,9 Milliarden Tokens in einer Max-20x-Woche und etwa 39 Millionen in einer Max-5x-Sitzung.
Wie senke ich den Token-Verbrauch von Claude Code?
Das sind die Änderungen mit der größten Wirkung auf den Verbrauch, grob nach Effekt geordnet.
- Zwischen nicht zusammenhängenden Aufgaben leeren.
/clearstartet einen frischen Kontext und kostet nichts. Nutzen Sie vorher/rename, wenn Sie die alte Sitzung später mit/resumefortsetzen wollen. - Die Effort-Stufe senken. Bei Opus 5.5 kostete eine Aufgabe in den Läufen von Artificial Analysis $5.98 bei maximalem und $1.34 bei mittlerem Effort, ein Unterschied von 4,5x durch eine einzige Einstellung. Ändern Sie sie mit
/effort. Details auf unserer Seite zu den Kosten der Effort-Stufen. - Das Modell zur Aufgabe passend wählen. Anthropic empfiehlt Sonnet für die meiste Programmierarbeit und Opus für schwierige Architektur- oder mehrstufige Aufgaben. Wechseln Sie mit
/modelund setzen Siemodel: haikubei einfachen Subagenten. - Keine langen Pausen mitten in der Sitzung. Der Prompt-Cache hält bei einem Abo eine Stunde und bei Nutzungs-Credits oder einem API-Schlüssel fünf Minuten. Kehren Sie nach Ablauf zurück, wird Ihr gesamter Kontext zum vollen Preis neu verarbeitet.
- Lautes Output aus dem Hauptkontext heraushalten. Schicken Sie Testläufe, das Lesen von Logs und das Abrufen von Dokumentation an Subagenten, sodass nur eine Zusammenfassung zurückkommt. Ein Hook kann ein Log mit 10.000 Zeilen auf die Fehlerzeilen reduzieren, bevor Claude es sieht.
- Das beim Start Geladene kürzen. Halten Sie CLAUDE.md unter etwa 200 Zeilen und verschieben Sie workflowspezifische Anweisungen in Skills, die nur bei Bedarf geladen werden. Deaktivieren Sie ungenutzte MCP-Server mit
/mcp. Bevorzugen Sie CLI-Tools wiegh, wo es eines gibt. - Präzise Prompts schreiben und zuerst planen. „Verbessere diese Codebasis“ lässt Claude alles durchsuchen. Der Plan-Modus (Shift+Tab) erkennt einen falschen Ansatz, bevor er eine komplette Implementierung kostet.
- Hintergrundarbeit im Blick behalten. Geplante Schleifen, Agent-Teammitglieder und untätige Subagenten senden weiter Ihren vollen Kontext. Agent-Teams verbrauchen etwa 7x so viele Tokens wie eine normale Sitzung, wenn die Teammitglieder im Plan-Modus laufen.
Spart /compact Tokens?
Nur bei späteren Anfragen, und das Komprimieren eines großen Kontexts ist selbst eine große Anfrage. /compact liest die gesamte Konversation, um sie zusammenzufassen. Brauchen Sie den Verlauf nicht, ist /clear billiger. Brauchen Sie ihn, behält /compact mit Anweisungen (zum Beispiel /compact keep the API changes and failing tests) das Wichtige. Mit /autocompact können Sie außerdem eine frühere Auto-Compact-Schwelle setzen.
Was kostet Claude Code pro Entwickler?
Anthropic nennt etwa $13 pro Entwickler und aktivem Tag sowie $150 bis $250 im Monat bei Enterprise-Einsätzen, und unter $30 am Tag für 90 % der Nutzer. Das wird zu API-Preisen abgerechnet. Bei einem Abo lautet die Frage, an wessen Planlimits Sie zuerst stoßen. Unsere Seite zum Wochenlimit von Claude Max bewertet eine Max-20x-Woche mit etwa $1.86k API-äquivalenter Nutzung.
Wie verfolgen Teams die Nutzung von Claude Code?
- Team- und Enterprise-Pläne: der Ausgabenbericht in den Org-Analysen, mit einer CSV pro Nutzer. Enterprise hat zudem eine Analytics-API. Ausgabenlimits werden in den Admin-Einstellungen gesetzt.
- API (Claude Console): die Nutzungsseite der Console und Ausgabenlimits pro Workspace.
- Jede Konfiguration: Setzen Sie
CLAUDE_CODE_ENABLE_TELEMETRY=1, um Token- und Kostenmetriken pro Nutzer über OpenTelemetry an Ihren eigenen Stack zu exportieren. Siehe die Monitoring-Dokumentation.
Zahlen Sie vertraglich vereinbarte Preise, sorgt die verwaltete Einstellung modelPricing dafür, dass die Kostenwerte in /usage und OpenTelemetry Ihrem Vertrag statt dem Listenpreis entsprechen.
Quellen
- Claude Code docs: Manage costs effectively
- Claude Code docs: Status line
- Claude Code docs: Monitoring usage
- Artificial Analysis: model benchmarks and cost per task
Weiterführend
- Wie viele Tokens Claude Pro und Max bieten
- Die Effort-Stufen von Opus 5.5 sind der wahre Preis
- Claude Max 20x vs 5x: das Wochenlimit, gemessen
Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →