Ekonomi unit API realtime dan audio
Diperbarui September 1, 2026 · pertama terbit September 1, 2026
Setiap model biaya yang dibangun untuk LLM teks akan rusak pada suara. Teks ditagih per token, dan token sebanding dengan informasi. Audio ditagih per durasi, dan durasi sebanding dengan waktu — termasuk semua waktu ketika tidak ada yang berguna terjadi.
Yang sebenarnya Anda bayar
Satu interaksi suara biasanya menumpuk tiga atau empat komponen yang ditagih. Speech-to-text untuk audio masuk. Pemanggilan model itu sendiri, yang pada API speech-to-speech realtime ditagih per menit audio masuk dan keluar, bukan per token. Text-to-speech untuk jalur balik, jika tumpukannya tidak end-to-end. Dan sering kali biaya terpisah untuk sesi yang tetap terbuka.
Yang terakhir adalah jebakannya. Sesi yang tetap terbuka saat pengguna berpikir, membaca sesuatu di layar, atau meninggalkan perangkat tetap merupakan sesi. Pada meteran per menit, keheningan adalah produk dengan harga penuh.
Di mana estimasi meleset
Tim memodelkan biaya suara sebagai waktu bicara × tarif dan hasilnya jauh di bawah angka sebenarnya. Ada empat hal yang hilang. Latensi dan jeda ditagih tetapi tidak dimodelkan. Interupsi berarti audio yang dihasilkan dan dibayar tidak pernah didengar penelepon. Percobaan ulang dan permintaan ulang memutar ulang seluruh pertukaran, dan percobaan ulang suara jauh lebih mahal daripada teks karena mengulang audio, bukan hanya token. Dan panggilan yang ditinggalkan menghabiskan biaya penuh durasi sampai ditutup tanpa menghasilkan apa pun.
Metrik yang berhasil
Biaya per percakapan yang selesai, bukan biaya per menit. Per menit adalah meteran, bukan satuan nilai bisnis — dan perubahan yang memperpendek panggilan lewat peningkatan model dapat menaikkan tarif per menit sekaligus menurunkan biaya untuk membawa penelepon ke jawaban.
Lalu instrumentasikan bagian yang tidak dilihat siapa pun: durasi sesi median dan p95, rasio waktu yang ditagih terhadap waktu yang diucapkan, tingkat abandon, dan biaya sesi yang ditinggalkan sebagai bagian dari total. Tutup sesi idle dengan agresif; batas waktu idle biasanya merupakan penghematan terbesar tunggal yang tersedia pada tumpukan suara. Dan perlakukan dukungan barge-in sebagai fitur biaya sekaligus fitur UX, karena setiap detik ucapan yang ditimpa pengguna adalah detik yang sudah Anda bayar untuk menghasilkannya.
Terkait
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →