Oossa

بهبود بهره‌وری ضرب ماتریسی MoE در llama.cpp

نسخه منتشرشده در ۳۰ سپتامبر ۲۰۲۶، انتخاب کاشی‌های Vulkan را اصلاح می‌کند و کار بیهوده در مدل‌های ترکیبی از متخصصان را کاهش می‌دهد.

خبر کوتاهOossaمنتشرشده توسط Oossa: 1 دقیقه مطالعه

کتابخانه متن‌باز llama.cpp اصلاحی برای ضرب ماتریسی آگاه از MoE در Vulkan اضافه کرده است. این تغییر نحوه انتخاب اندازه کاشی‌ها را برای عملیات mat_mul_id تنظیم می‌کند تا با تعداد واقعی ردیف‌های فعال برای هر متخصص مطابقت داشته باشد. در آزمایشی روی مدلی با ۳۰ میلیارد پارامتر، این اصلاح کار بیهوده GPU را که ۵۵ درصد زمان اجرا را می‌گرفت، کاهش داد.

چرا مهم است

کاهش زمان بیکاری GPU یعنی استنتاج سریع‌تر برای مدل‌های بزرگ MoE که روی سخت‌افزار سازگار با Vulkan اجرا می‌شوند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.