کتابخانه متنباز llama.cpp اصلاحی برای ضرب ماتریسی آگاه از MoE در Vulkan اضافه کرده است. این تغییر نحوه انتخاب اندازه کاشیها را برای عملیات mat_mul_id تنظیم میکند تا با تعداد واقعی ردیفهای فعال برای هر متخصص مطابقت داشته باشد. در آزمایشی روی مدلی با ۳۰ میلیارد پارامتر، این اصلاح کار بیهوده GPU را که ۵۵ درصد زمان اجرا را میگرفت، کاهش داد.
چرا مهم است
کاهش زمان بیکاری GPU یعنی استنتاج سریعتر برای مدلهای بزرگ MoE که روی سختافزار سازگار با Vulkan اجرا میشوند.