أصدر مشروع ggml‑org/llama.cpp الإصدار b11372 في 3 أكتوبر 2026. ويعيد التحديث كتابة مفهرس Qwen4exp بحيث يحسب كل رأس درجته على حدة ويكتب النتائج في مكانها. ويؤدي ذلك إلى خفض الذاكرة اللازمة لمخازن درجات المفهرس إلى النصف، وهي أكبر مستهلك للذاكرة في الرسوم البيانية ذات السياقات الطويلة. ولا يؤثر هذا التغيير في سرعة المعالجة، كما يضيف دعمًا لمفهرس lightning الجديد على الواجهات الخلفية CUDA وMetal وVulkan.
لماذا يهم
سيتمكن المطورون الذين يشغّلون نماذج لغوية كبيرة بسياقات طويلة من إدخال مطالبات أكبر على الأجهزة نفسها.