أضافت مكتبة llama.cpp مفتوحة المصدر إصلاحًا في Vulkan لضرب المصفوفات المراعي لبنية MoE. ويعدّل التغيير طريقة اختيار الشيفرة لأحجام البلاطات في عملية mat_mul_id، بحيث تتوافق مع العدد الفعلي للصفوف النشطة لدى كل خبير. وفي اختبار أُجري على نموذج يضم 30 مليار مُعامل، قلّل الإصلاح وقت عمل وحدة GPU الخامل، الذي كان يشكل 55% من مدة التشغيل.
لماذا يهم
يعني تقليل وقت خمول وحدة GPU استدلالًا أسرع لنماذج MoE الكبيرة التي تعمل على أجهزة متوافقة مع Vulkan.