Quick answer: Streaming suggeriert Schnelligkeit, doch wenn der Nutzer den Tab schließt oder auf Stop klickt, rechnet der Modellprovider oft bis zum Tokenlimit weiter ab. Die sichtbare Ausgabe ist kurz, die...

Streaming-Antworten und abgebrochene Token

Updated September 9, 2026 · first published September 9, 2026

Streaming suggeriert Schnelligkeit, doch wenn der Nutzer den Tab schließt oder auf Stop klickt, rechnet der Modellprovider oft bis zum Tokenlimit weiter ab. Die sichtbare Ausgabe ist kurz, die Rechnung aber hoch.

Abbrüche nach Upstream propagieren

Reichen Sie Client-Disconnections per AbortController direkt an die API des Providers durch, um verwaiste Token zu vermeiden.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research