أصدر مشروع llama.cpp الإصدار b11554 في 2026‑10‑11. ويضيف التحديث إصلاحات خاصة بـVulkan تكشف معرّفات الصفوف المكررة في عمليات ضرب المصفوفات، وتعالجها في مرحلة تمهيدية بدلًا من تكرار العمل ضمن حلقة. كما يحسّن خيار «hoist row ids» بحيث يُنفّذ دائمًا، ويمكنه إنتاج عدة بلاطات مدمجة. وتتيح هذه التغييرات لوحدة GPU إطلاق مجموعات عمل أقل، وإنهاء التنفيذ مبكرًا متى أمكن.
لماذا يهم
قد يلاحظ مستخدمو llama.cpp على وحدات GPU استدلالًا أسرع، لأن المكتبة تتجنب الآن تكرار الحسابات نفسها.