Respons streaming dan generasi yang ditinggalkan
Diperbarui September 9, 2026 · pertama terbit September 9, 2026
Streaming membuat produk AI terasa cepat, tetapi juga membuat respons yang belum selesai mudah disangka permintaan yang sudah dibatalkan. Pengguna menutup tab, kehilangan koneksi, atau menekan stop; penyedia mungkin terus menghasilkan sampai permintaan dibatalkan atau output mencapai batasnya. Respons yang terlihat lebih pendek, tetapi tagihannya belum tentu ikut lebih pendek.
Ekor yang ditinggalkan adalah biaya nyata
Lacak tiga peristiwa secara terpisah: waktu hingga token pertama, token yang sampai ke klien, dan token yang dihasilkan di hulu. Selisih antara output yang terkirim dan yang dihasilkan adalah ekor yang ditinggalkan. Itu mewakili pekerjaan yang tidak pernah diterima pengguna, dan bisa besar pada jawaban panjang, agen pengkodean, serta alur kerja yang memakai tool.
Jangan hanya mengukur ini sebagai persentase permintaan. Sejumlah kecil generasi yang ditinggalkan dengan token banyak bisa mendominasi pemborosan. Laporkan token output yang ditinggalkan dan biayanya menurut fitur, model, perangkat, jenis koneksi, dan alasan pembatalan.
Pembatalan harus sampai ke hulu
Menghentikan renderer browser tidak sama dengan menghentikan permintaan model. Teruskan pemutusan klien atau aksi stop eksplisit melalui gateway Anda ke permintaan penyedia. Beri masa tenggang singkat untuk koneksi ulang, lalu batalkan. Untuk alur kerja agen, batalkan generasi yang aktif dan pekerjaan tool yang masih antre tetapi sudah tidak punya tugas induk yang hidup.
Simpan pengenal permintaan yang idempoten agar balapan pembatalan tidak menghasilkan pencatatan ganda. Catat apakah penyedia mengonfirmasi pembatalan; jika tidak, golongkan token sisanya sebagai belanja yang belum pasti, bukan diam-diam menyebutnya penghematan.
Gunakan KPI yang lebih baik
Biaya per permintaan menyesatkan ketika banyak respons ditinggalkan. Gunakan biaya per respons yang terkirim dan biaya per tugas berhasil, lalu tampilkan tingkat peninggalan di samping keduanya. Perubahan produk yang menaikkan waktu hingga token pertama bisa menaikkan peninggalan, meskipun total token per permintaan tetap sama.
Kontrol praktis
- Kirim peristiwa pembatalan dengan permintaan, fitur, model, dan penghitung token.
- Batalkan pekerjaan hulu saat terputus dan saat stop eksplisit.
- Batasi output maksimum untuk beban kerja interaktif.
- Bandingkan token yang dihasilkan, terkirim, dan ditagih saat rekonsiliasi faktur.
- Beri peringatan ketika biaya token yang ditinggalkan naik lebih cepat daripada volume tugas berhasil.
Terkait
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →