Die Bruttomarge eines KI-Features vor dem Launch messen
Updated September 2, 2026 · first published September 2, 2026
Inferenz ist ein Servicekosten-Block, kein Entwicklungsaufwand. Sie läuft bei jeder Kundenaktion und wächst mit der Nutzung. Wer sie bis zum Launch als F&E führt, erfährt die echte Marge erst mit der ersten vollen Rechnung.
Vor dem Launch instrumentieren
Markieren Sie in Staging jeden Modellaufruf nach Konto, Workflow und Ergebnis und spielen Sie realistischen Traffic ein. Gebraucht wird eine Verteilung: Kosten je erfolgreicher Aufgabe bei p50, p90 und p99, plus der bezahlte Anteil für Fehlläufe und Retries.
Kosten je Konto
Kosten je erfolgreicher Aufgabe mal erwartete Monatsaufgaben, plus Fehlläufe. Vergleichen Sie mit dem Planpreis bei Median, 90. Perzentil und dem schwersten noch akzeptablen Konto.
Vier Kostentreiber
Kontext in jedem Turn erneut berechnet, voll berechnete Retries, agentische Vervielfachung einer Aktion, und Routing, das einfache Fälle an ein teures Modell schickt.
An eine Entscheidung koppeln
Nutzungsobergrenze, Verbrauchskomponente im Preis, günstigeres Standardmodell oder bewusst akzeptierte Marge mit Review-Termin. Als eigene Zeile der Bruttomarge berichten.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →