Ekonomia jednostkowa API realtime i audio
Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026
Każdy model kosztów zbudowany dla tekstowych LLM załamuje się przy głosie. Tekst rozlicza się tokenami, a tokeny są proporcjonalne do informacji. Audio rozlicza się za czas trwania, a czas trwania jest proporcjonalny do czasu — łącznie z całym czasem, w którym nic użytecznego się nie dzieje.
Za co naprawdę płacisz
Interakcja głosowa to zwykle trzy lub cztery rozliczane składniki nałożone na siebie. Zamiana mowy na tekst dla wejściowego audio. Samo wywołanie modelu, które w API realtime speech-to-speech jest wyceniane za minutę audio wejściowego i wyjściowego, a nie za token. Zamiana tekstu na mowę w drodze powrotnej, jeśli stos nie jest end-to-end. I często osobna opłata za to, że sesja pozostaje otwarta.
Ta ostatnia to pułapka. Sesja utrzymywana otwartą, gdy użytkownik myśli, czyta coś na ekranie albo odchodzi, nadal jest sesją. Przy liczniku za minutę cisza to produkt po pełnej cenie.
Gdzie szacunki się mylą
Zespoły modelują koszt głosu jako czas mówienia × stawka i wychodzą znacznie poniżej rzeczywistości. Brakuje czterech rzeczy. Opóźnienia i pauzy są rozliczane, ale nie modelowane. Przerwania oznaczają wygenerowane i zapłacone audio, którego rozmówca nigdy nie usłyszał. Ponowienia i ponowne prompty odtwarzają całą wymianę, a ponowienie głosowe jest znacznie droższe niż tekstowe, bo powtarza audio, a nie tylko tokeny. A porzucone rozmowy kosztują pełny czas aż do rozłączenia, nie dając nic w zamian.
Metryka, która działa
Koszt na zakończoną rozmowę, a nie koszt na minutę. Minuta to licznik, a nie jednostka wartości biznesowej — zmiana, która skraca rozmowy dzięki lepszemu modelowi, może podnieść stawkę za minutę, a jednocześnie obniżyć koszt doprowadzenia rozmówcy do odpowiedzi.
Następnie zainstrumentuj części, których nikt nie widzi: medianę i p95 czasu trwania sesji, stosunek rozliczonego czasu do czasu mówionego, wskaźnik porzuceń oraz koszt porzuconych sesji jako udział w całości. Agresywnie zamykaj bezczynne sesje; limit bezczynności to zwykle największa dostępna oszczędność w stosie głosowym. I traktuj obsługę barge-in jako funkcję kosztową równie mocno jak UX, bo każda sekunda mowy, na którą użytkownik nachodzi, to sekunda, za którą zapłaciłeś, by ją wygenerować.
Powiązane
Powiązane
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →