Quick answer: Inferenz ist ein Servicekosten-Block, kein Entwicklungsaufwand. Sie läuft bei jeder Kundenaktion und wächst mit der Nutzung. Wer sie bis zum Launch als F&E führt, erfährt die echte Marge erst mit...

Die Bruttomarge eines KI-Features vor dem Launch messen

Updated September 2, 2026 · first published September 2, 2026

Inferenz ist ein Servicekosten-Block, kein Entwicklungsaufwand. Sie läuft bei jeder Kundenaktion und wächst mit der Nutzung. Wer sie bis zum Launch als F&E führt, erfährt die echte Marge erst mit der ersten vollen Rechnung.

Vor dem Launch instrumentieren

Markieren Sie in Staging jeden Modellaufruf nach Konto, Workflow und Ergebnis und spielen Sie realistischen Traffic ein. Gebraucht wird eine Verteilung: Kosten je erfolgreicher Aufgabe bei p50, p90 und p99, plus der bezahlte Anteil für Fehlläufe und Retries.

Kosten je Konto

Kosten je erfolgreicher Aufgabe mal erwartete Monatsaufgaben, plus Fehlläufe. Vergleichen Sie mit dem Planpreis bei Median, 90. Perzentil und dem schwersten noch akzeptablen Konto.

Vier Kostentreiber

Kontext in jedem Turn erneut berechnet, voll berechnete Retries, agentische Vervielfachung einer Aktion, und Routing, das einfache Fälle an ein teures Modell schickt.

An eine Entscheidung koppeln

Nutzungsobergrenze, Verbrauchskomponente im Preis, günstigeres Standardmodell oder bewusst akzeptierte Marge mit Review-Termin. Als eigene Zeile der Bruttomarge berichten.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research