De unit economics van realtime- en audio-API's
Bijgewerkt September 1, 2026 · eerst gepubliceerd September 1, 2026
Elk kostenmodel dat voor tekst-LLM's is gebouwd, gaat stuk op spraak. Tekst wordt per token gefactureerd en tokens zijn evenredig met informatie. Audio wordt per duur gefactureerd en duur is evenredig met tijd — inclusief alle tijd waarin niets nuttigs gebeurt.
Waarvoor je echt betaalt
Een spraakinteractie bestaat meestal uit drie of vier gefactureerde onderdelen op elkaar gestapeld. Speech-to-text op de inkomende audio. De modelaanroep zelf, die bij realtime speech-to-speech-API's per minuut audio in en uit wordt geprijsd in plaats van per token. Text-to-speech op de terugweg, als de stack niet end-to-end is. En vaak een aparte vergoeding omdat de sessie open blijft.
Dat laatste is de valkuil. Een sessie die openstaat terwijl een gebruiker nadenkt, iets op het scherm leest of weggaat, is nog steeds een sessie. Op een meter per minuut is dode lucht een product tegen volle prijs.
Waar de schattingen misgaan
Teams modelleren spraakkosten als spreektijd × tarief en komen ruim onder de werkelijkheid uit. Vier dingen ontbreken. Latentie en pauzes worden gefactureerd maar niet gemodelleerd. Onderbrekingen betekenen audio die is gegenereerd en betaald maar die de beller nooit heeft gehoord. Retries en herhaalde prompts spelen de hele uitwisseling opnieuw af, en een spraakretry is veel duurder dan een tekstretry omdat de audio wordt herhaald, niet alleen de tokens. En afgebroken gesprekken kosten de volledige duur tot het ophangen terwijl ze niets opleveren.
De metriek die werkt
Kosten per afgerond gesprek, niet kosten per minuut. Per minuut is de meter, niet de eenheid van zakelijke waarde — en een wijziging die gesprekken inkort door het model te verbeteren kan het tarief per minuut verhogen terwijl de kosten om een beller aan een antwoord te helpen dalen.
Instrumenteer vervolgens de onderdelen die niemand ziet: mediane en p95-sessieduur, verhouding tussen gefactureerde en gesproken tijd, afbreekpercentage en de kosten van afgebroken sessies als aandeel van het totaal. Sluit inactieve sessies agressief af; een idle timeout is meestal de grootste besparing die in een spraakstack beschikbaar is. En behandel barge-in-ondersteuning als een kostenfeature net zozeer als een UX-feature, want elke seconde spraak waar een gebruiker doorheen praat, is een seconde die je hebt betaald om te genereren.
Gerelateerd
Gerelateerd
Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →