Langsung ke konten

Respons streaming dan generasi yang ditinggalkan

Diperbarui September 9, 2026 · pertama terbit September 9, 2026

Jawaban singkat: Streaming membuat produk AI terasa cepat, tetapi juga membuat respons yang belum selesai mudah disangka permintaan yang sudah dibatalkan. Pengguna menutup tab, kehilangan koneksi, atau menekan stop;...

Streaming membuat produk AI terasa cepat, tetapi juga membuat respons yang belum selesai mudah disangka permintaan yang sudah dibatalkan. Pengguna menutup tab, kehilangan koneksi, atau menekan stop; penyedia mungkin terus menghasilkan sampai permintaan dibatalkan atau output mencapai batasnya. Respons yang terlihat lebih pendek, tetapi tagihannya belum tentu ikut lebih pendek.

Ekor yang ditinggalkan adalah biaya nyata

Lacak tiga peristiwa secara terpisah: waktu hingga token pertama, token yang sampai ke klien, dan token yang dihasilkan di hulu. Selisih antara output yang terkirim dan yang dihasilkan adalah ekor yang ditinggalkan. Itu mewakili pekerjaan yang tidak pernah diterima pengguna, dan bisa besar pada jawaban panjang, agen pengkodean, serta alur kerja yang memakai tool.

Jangan hanya mengukur ini sebagai persentase permintaan. Sejumlah kecil generasi yang ditinggalkan dengan token banyak bisa mendominasi pemborosan. Laporkan token output yang ditinggalkan dan biayanya menurut fitur, model, perangkat, jenis koneksi, dan alasan pembatalan.

Pembatalan harus sampai ke hulu

Menghentikan renderer browser tidak sama dengan menghentikan permintaan model. Teruskan pemutusan klien atau aksi stop eksplisit melalui gateway Anda ke permintaan penyedia. Beri masa tenggang singkat untuk koneksi ulang, lalu batalkan. Untuk alur kerja agen, batalkan generasi yang aktif dan pekerjaan tool yang masih antre tetapi sudah tidak punya tugas induk yang hidup.

Simpan pengenal permintaan yang idempoten agar balapan pembatalan tidak menghasilkan pencatatan ganda. Catat apakah penyedia mengonfirmasi pembatalan; jika tidak, golongkan token sisanya sebagai belanja yang belum pasti, bukan diam-diam menyebutnya penghematan.

Gunakan KPI yang lebih baik

Biaya per permintaan menyesatkan ketika banyak respons ditinggalkan. Gunakan biaya per respons yang terkirim dan biaya per tugas berhasil, lalu tampilkan tingkat peninggalan di samping keduanya. Perubahan produk yang menaikkan waktu hingga token pertama bisa menaikkan peninggalan, meskipun total token per permintaan tetap sama.

Kontrol praktis

Terkait

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com