실시간 및 오디오 API의 단위 경제학
업데이트 September 1, 2026 · 최초 게시 September 1, 2026
텍스트 LLM을 위해 만든 비용 모델은 음성에서 모두 깨집니다. 텍스트는 정보량에 비례하는 토큰 단위로 과금되지만, 오디오는 시간에 비례하는 길이 단위로 과금됩니다. 아무 유용한 일도 일어나지 않는 시간까지 포함해서요.
실제로 무엇에 돈을 내는가
음성 상호작용 한 번에는 보통 3~4개의 과금 항목이 쌓입니다. 들어오는 음성의 음성 인식, 모델 호출 자체(실시간 음성 대 음성 API에서는 토큰이 아니라 입출력 오디오의 분 단위로 과금), 파이프라인이 엔드투엔드가 아니라면 돌아가는 음성 합성, 그리고 종종 세션을 열어 둔 상태에 대한 별도 요금입니다.
마지막 항목이 함정입니다. 사용자가 생각하거나 화면을 읽거나 자리를 비운 동안 열려 있는 세션도 여전히 세션입니다. 분 단위 과금에서는 무음도 정가 상품입니다.
추정이 빗나가는 지점
많은 팀이 음성 비용을 발화 시간 × 단가로 모델링해서 실제보다 한참 낮게 잡습니다. 빠진 것이 네 가지 있습니다. 지연과 일시 정지는 과금되지만 모델링되지 않습니다. 끼어들기는 발신자가 듣지도 않은 생성 음성에 돈을 내는 것을 뜻합니다. 재시도와 재프롬프트는 전체 대화를 다시 재생하며, 음성 재시도는 토큰뿐 아니라 오디오를 반복하므로 텍스트 재시도보다 훨씬 비쌉니다. 그리고 중도 포기된 통화는 끊길 때까지 전체 시간이 과금되는데 아무 결과도 만들지 않습니다.
효과가 있는 지표
분당 비용이 아니라 완료된 대화당 비용을 보세요. 분당 요금은 측정 단위일 뿐 사업 가치의 단위가 아닙니다. 모델을 개선해서 통화를 짧게 만드는 변경은 분당 요금을 올리면서도 발신자가 답에 도달하는 비용을 낮출 수 있습니다.
그다음 아무도 보지 않는 부분을 계측하세요. 세션 길이의 중앙값과 p95, 과금 시간 대비 발화 시간의 비율, 포기율, 전체 대비 포기된 세션의 비용 비중. 유휴 세션은 공격적으로 닫으세요. 유휴 타임아웃은 보통 음성 스택에서 얻을 수 있는 가장 큰 단일 절감 항목입니다. 그리고 바지인(끼어들기) 지원을 UX 기능인 동시에 비용 기능으로 취급하세요. 사용자가 겹쳐서 말한 발화의 매 초는 생성하느라 돈을 낸 초이기 때문입니다.
관련 글
관련 글
이 내용을 현재 스택에 적용하고 싶으신가요? 공급업체 청구서, 게이트웨이 로그, 주요 워크플로를 가져오시면 비용 요인과 절감 경로를 정리해드립니다. 무료 감사 예약 →