اعثر على إخفاق التخزين المؤقت خلف فاتورة OpenAI
آخر تحديث September 26, 2026 · نُشر أول مرة September 26, 2026
تستطيع لوحة تخزين الموجّهات المؤقت أن تخبرك بأن إعادة الاستخدام انخفضت. لكنها لا تستطيع وحدها أن تخبرك أي تغيير في الطلب تسبب في الانخفاض أو كم كلّف. جعل إصدار 8 سبتمبر 2026 من OpenAI أداة Prompt Cache Diagnostics متاحة للعموم في Responses API لنموذج GPT-5.6 والنماذج المدعومة اللاحقة. والخطوة المفيدة لـ FinOps هي تحويل انخفاض الرموز المخزّنة مؤقتاً إلى تحقيق قصير قابل للتكرار.
قارن الطلب الذي أخفق
احفظ معرّف استجابة حديثة مكتملة كنت تتوقع إعادة استخدام بادئتها. وفي طلب Responses API المماثل التالي من المؤسسة نفسها، اضبط prompt_cache_options.comparison_response_id على ذلك المعرّف. ثم اقرأ prompt_cache_diagnostics في الاستجابة الجديدة، إلى جانب usage.input_tokens_details.cached_tokens. خيار المقارنة يطلب تشخيصاً؛ فهو لا يحمّل المحادثة السابقة ولا يغيّر سلوك التخزين المؤقت. ويتضمن دليل التشخيص لدى OpenAI أمثلة طلبات عاملة.
const next = await client.responses.create({
model: model,
instructions: stableInstructions,
input: nextInput,
tools: stableTools,
prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);يفترض المقتطع أن baseline استجابة حديثة مكتملة وأن بقية المتغيرات بيانات طلبك أنت. أبقِ بادئة مستقرة طويلة بما يكفي للتخزين المؤقت: توثّق OpenAI حداً أدنى قدره 1,024 رمزاً لـ GPT-5.6 وما بعده. والموجّه الصغير أو المختلف جذرياً ليس اختباراً ذا معنى لإخفاق التخزين المؤقت.
عالج السبب لا المقياس
قد تشير نتيجة cache_miss إلى تغيير في النموذج أو فئة الخدمة أو تعريفات الأدوات أو ترتيبها أو مفتاح التخزين المؤقت أو صيغة الاستجابة أو جهد الاستدلال أو درجة الإسهاب أو السياق المضغوط. فمثلاً، قد يُبطل تغيير اسم في مخطط الأداة يبدو بريئاً البادئة القابلة لإعادة الاستخدام. قارن إعدادات الطلب وأبكر بايتات الموجّه، واستعد الاستقرار حيث كان التغيير عرضياً، ثم أعد المقارنة مقابل خط الأساس نفسه. تبلغ OpenAI عن أول سبب تجده، لذا قد يظهر سبب آخر بعد الإصلاح الأول.
لا تفرض إصابة (hit) إذا كان التغيير مقصوداً. فقد يخفض نموذج مختلف الكلفة الإجمالية للمهمة حتى مع فقدان إعادة الاستخدام؛ وقد يقلل الضغط السياق في المستقبل. احكم على الطلب والمهمة بأكملهما، لا على نسبة إصابة التخزين المؤقت بمعزل. أما خط الأساس المنتهي الصلاحية أو نتيجة unavailable فهي غير حاسمة، وليست دليلاً على فشل التخزين المؤقت.
حوّل النتيجة إلى مال
يقدّر cache_missed_tokens الرموز القابلة لإعادة الاستخدام التي فُقدت قياساً إلى الاستجابة المقارَنة. وهو ليس عدداً للرموز المفوترة. كذلك لا تثبت نتيجة cache_hit توفيراً بالدولار. وللحصول على كلفة الإدخال المتحققة، اجمع input_tokens الإجمالي وcached_tokens وcache_write_tokens لكل استجابة، ثم طبّق السعر الحالي لذلك النموذج وفئة المعالجة. ولـ GPT-5.6 وما بعده، يذكر دليل تخزين الموجّهات المؤقت لدى OpenAI أن قراءات التخزين المؤقت تكلف 0.1 من سعر الإدخال غير المخزّن، وأن كتابات التخزين المؤقت تكلف 1.25 ضعف ذلك السعر.
ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000هذه فئات رموز متنافية: فلا تضف رسم كتابة التخزين المؤقت إلى رموز احتُسبت أصلاً بسعر الكتابة. وتغطي هذه المعادلة الإدخال فقط؛ فأدرج الإخراج والأدوات وإعادات المحاولة والرسوم الأخرى عند حساب الكلفة لكل مهمة ناجحة. واستخدم جدول الأسعار الحالي لدى المزود بدلاً من سعر مكتوب في المقال.
فحص أسبوعي مفيد
- جمّع الحركة المماثلة بحسب حمل العمل والنموذج وفئة الخدمة؛ وارسم حصة الرموز المخزّنة مؤقتاً وكلفة الإدخال لكل مهمة مكتملة.
- خذ عينة من تراجع مفاجئ، وقارنه بخط أساس حديث، وسجّل سبب التشخيص وتغيير الشيفرة المسؤول.
- أصلح انجراف البادئة أو الإعدادات العرضي؛ وأبقِ تغييرات الجودة أو التوجيه المقصودة إذا تحسنت اقتصاديات المهمة الإجمالية.
- تحقق من النتيجة عبر حركة إنتاج تمثيلية وطابق التوفير الملاحَظ مع الفوترة.
لا رسوم إضافية على ميزة التشخيص نفسها، لكن طلبات الاختبار الإضافية تُفوتر بصورة عادية. والمردود ليس رسماً أجمل لمعدل الإصابة، بل تفسير يمكن الدفاع عنه لسبب تغيّر كلفة إدخال حمل عمل معين — وهل خفّض الإصلاح المقترح فاتورته فعلاً.
أسئلة تطرحها الفرق
هل يثبت تشخيص إصابة التخزين المؤقت أن الطلب كان أرخص؟
لا. فهو يعني أنه لم يُكتشف إخفاق مقارنةً بخط الأساس المحدد. تحقق من cached_tokens الفعلية وفئات الرموز المسعَّرة للطلب قبل الادعاء بوجود توفير.
هل يستطيع التشخيص مقارنة أي طلبين من OpenAI؟
لا. استخدم خط أساس حديثاً مكتملاً من المؤسسة نفسها، ولا تتوقع سير العمل هذا إلا على نماذج Responses API المدعومة من GPT-5.6 فما بعد. وقد ينتهي سجل المقارنة.
هل ينبغي إزالة كل إخفاق في التخزين المؤقت؟
لا. فتبديل النموذج أو فئة الخدمة أو ضغط السياق قد يكون مقصوداً. قارن الجودة وزمن الاستجابة والكلفة لكل مهمة ناجحة قبل التراجع عن التغيير.
مقالات ذات صلة
هل تريد تطبيق ذلك على منصتك؟ أحضر فواتير المزوّدين وسجلات البوابة وأهم تدفقات العمل؛ وسنحدد محركات التكلفة وفرص التوفير. احجز تدقيقًا مجانيًا →