تكلفة الردود المتدفقة المهجورة على الميزانية
Updated September 9, 2026 · first published September 9, 2026
يعد التدفق السريع للردود (Streaming Responses) المعيار الذهبي لتجربة المستخدم في تطبيقات الذكاء الاصطناعي، حيث يرى العميل الكلمات تتوالى فور توليدها. ولكن ماذا يحدث عندما يقرأ المستخدم أول سطرين، ويحصل على مبتغاه، ثم يغلق علامة تبويب المتصفح أو يطرح سؤالاً جديداً فوراً؟ في كثير من الأحيان، يستمر الخادم في توليد مئات الرموز ودفع ثمنها للمزود في الخلفية دون أن يراها أحد.
ظاهرة الاستجابات المهجورة (Abandoned Generations)
عندما ينقطع العميل، لا يعلم المزود السحابي بذلك تلقائياً إلا إذا تم إرسال إشارة إلغاء صريحة عبر بروتوكول HTTP. إذا استمر النموذج في كتابة فقرة من 800 رمز أهملها المستخدم بعد أول 50 رمزاً، فإن 93% من تكلفة رموز الإخراج لتلك العملية ذهبت هدراً كاملاً.
الحلول الهندسية لإيقاف الهدر
للقضاء على تكلفة الردود المهجورة:
- ربط إشارات الإلغاء (AbortController Propagation): تمرير إشارة انقطاع اتصال العميل فوراً إلى استدعاء واجهة برمجة التطبيقات للمزود عبر السلسلة البرمجية بأكملها.
- رصد ومراقبة معدل الهجر: قياس نسبة الرموز المولدة التي لم تصل للعميل، واستخدامها كمؤشر هندسي لجودة التفاعل وسرعة الاستجابة.
- إيقاف التوليد التلقائي عند بدء طلب جديد: إلغاء أي مهام سابقة في الجلسة ذاتها فور قيام المستخدم بإرسال رسالة جديدة.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →