Streaming-Antworten und abgebrochene Token
Updated September 9, 2026 · first published September 9, 2026
Streaming suggeriert Schnelligkeit, doch wenn der Nutzer den Tab schließt oder auf Stop klickt, rechnet der Modellprovider oft bis zum Tokenlimit weiter ab. Die sichtbare Ausgabe ist kurz, die Rechnung aber hoch.
Abbrüche nach Upstream propagieren
Reichen Sie Client-Disconnections per AbortController direkt an die API des Providers durch, um verwaiste Token zu vermeiden.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →