كلفة المشكلة المحلولة في Real-SWE
آخر تحديث September 27, 2026 · نُشر أول مرة September 27, 2026
صدر Real-SWE في 12 سبتمبر 2026 وحصد 275 نقطة و158 تعليقاً على Hacker News. فرضيته هي الجزء الذي تخطئ فيه معظم نماذج الكلفة: مجموعات المعايير عامة ومحفوظة عن ظهر قلب وغير ممثّلة للشيفرة التي يلمسها وكلاؤك فعلاً. يشغّل Real-SWE النماذج على مستودعات مؤسسية واقعية وخاصة.
لماذا رقم الكلفة أهم من الدرجة
المعيار العام يعطيك معدل نجاح. ولا يعطيك كلفة. والكلفة لكل مشكلة محلولة تحتاج إلى ثلاثة أشياء معاً:
- معدل النجاح في المهام الصعبة الخاصة.
- الرموز المستهلكة لكل محاولة، بما فيها المحاولات الفاشلة.
- عدد المحاولات — هل احتاج النموذج إلى إعادة محاولة أو مراجعة خطة أو حلقة مقارنة وإعادة تفكير؟
اضرب هذه معاً تحصل على الرقم الوحيد الذي يقابل بنداً في الميزانية. نموذج يسجّل أقل من المتصدر بـ 4 نقاط لكنه يحل المشكلات في محاولة واحدة بثلث الرموز هو أرخص لكل مشكلة محلولة، وفي قائمة أعمال حقيقية يتراكم هذا الفارق أسرع مما توحي به فجوة الدرجات.
لماذا تبالغ المعايير العامة في الجودة
قواعد الشيفرة المؤسسية فيها الخصائص التي تكسر افتراضات المعايير العامة: أعراف داخلية طويلة، وثوابت غير موثقة، واختبارات تحمل في داخلها حوادث تاريخية، وأنظمة بناء لا يفهمها أحد بالكامل. النموذج الذي يطابق الأنماط في مستودع عام لا يستطيع مطابقة الأنماط في مستودع أحادي من 400 ملف تراكمت فيه قرارات ثلاث سنوات. ولهذا كانت إحدى النتائج الأكثر نقاشاً هذا الشهر نموذج كتابة إبداعية مفتوح الأوزان بحجم 27B يعمل بمستوى Fable 5 بسعر أرخص بـ 40 ضعفاً حسب ما أُفيد — فالأوزان المفتوحة تنطلق من معرفة مسبقة بالمستودع المحلي تفتقر إليها نماذج API.
إجراء الحساب
خذ مستودعاً خلفياً حقيقياً فيه 40 مشكلة ضمن النطاق. لنفترض أن النموذج الأرخص يحل 22 في محاولة واحدة بـ 60K إدخال / 8K إخراج، وأن النموذج المتميز يحل 26 بمضاعف إعادة محاولة 1.4 مرة بـ 90K إدخال / 14K إخراج. بأسعار Opus 5.5 ($4/$20، وقراءات التخزين المؤقت $0.20):
| النموذج | المحلول | الكلفة لكل مشكلة | الإجمالي |
|---|---|---|---|
| الفئة الرخيصة | 22 | $0.32 | $7.04 | الفئة المتميزة | 26 | $0.61 | $15.86 |
تكلف الفئة المتميزة 2.3 ضعف الإجمالي مقابل 18% مشكلات محلولة أكثر. وعلى قائمة من 40 مشكلة يعني ذلك 9 دولارات إضافية. أما المقايضة نفسها عند 4,000 مشكلة شهرياً فتبلغ 880 دولاراً — ولا تشتري إلا 18% إنتاجية إضافية. الفئة الأرخص ليست خاطئة بوضوح؛ فأنت تقايض معدل الحل بالحجم، والجواب الصحيح يتوقف على ما إذا كانت مشكلة فائتة تكلّف أكثر من دولار.
ما الذي ينبغي قياسه
- الكلفة لكل مشكلة محلولة لا لكل محاولة. المقام هو طلبات الدمج المقبولة لا الطلبات.
- مضاعف إعادة المحاولة لكل نموذج. نموذج بمضاعف 1.4 يخسر ثلث سعره المعلن قبل أن تحتسب أي شيء آخر.
- الرموز لكل فرق مقبول، بما فيها رموز الخطة والمراجعة الذاتية التي لا يُظهرها الفرق أبداً.
- دقائق المراجعة البشرية. نموذج أرخص بـ 12% لكن مراجعته أطول بـ 20% هو أغلى.
الخلاصة
تصنّف المعايير العامة القدرة على مهام لا تشبه قائمة أعمالك. و Real-SWE محاولة مبكرة للنسخة الصادقة. إلى أن تشغّله على مستودعاتك أنت، عامل كل مقارنة بين النماذج على أنها فرضية كلفة لكل مشكلة محلولة، وسعّر الفرضية بأعداد الرموز الخاصة بك.
مقالات ذات صلة
- الكلفة الحقيقية لكل مهمة: النماذج الرائدة
- الكلفة لكل مهمة ناجحة
- كلفة البرمجة الوكيلية الكثيفة: Claude مقابل Qwen
- ضبط كلفة التقييمات
- تسعير نموذج مفتوح الأوزان
هل تريد تطبيق ذلك على منصتك؟ أحضر فواتير المزوّدين وسجلات البوابة وأهم تدفقات العمل؛ وسنحدد محركات التكلفة وفرص التوفير. احجز تدقيقًا مجانيًا →