# بهبود بهره‌وری ضرب ماتریسی MoE در llama.cpp

> نسخه منتشرشده در ۳۰ سپتامبر ۲۰۲۶، انتخاب کاشی‌های Vulkan را اصلاح می‌کند و کار بیهوده در مدل‌های ترکیبی از متخصصان را کاهش می‌دهد.

Oossa · 2026-09-29 · https://oossa.com/fa/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

با کمک هوش مصنوعی تهیه و ترجمه شده است. منابع اصلی زیر را بررسی کنید.

کتابخانه متن‌باز llama.cpp اصلاحی برای ضرب ماتریسی آگاه از MoE در Vulkan اضافه کرده است. این تغییر نحوه انتخاب اندازه کاشی‌ها را برای عملیات mat_mul_id تنظیم می‌کند تا با تعداد واقعی ردیف‌های فعال برای هر متخصص مطابقت داشته باشد. در آزمایشی روی مدلی با ۳۰ میلیارد پارامتر، این اصلاح کار بیهوده GPU را که ۵۵ درصد زمان اجرا را می‌گرفت، کاهش داد.

## حقایق

- نسخه b11265 در ۳۰ سپتامبر ۲۰۲۶ منتشر شد
- در آزمایش Sarvam 30B، اتلاف عملکرد از ۵۵ درصد به نزدیک صفر رسید

## چرا مهم است

کاهش زمان بیکاری GPU یعنی استنتاج سریع‌تر برای مدل‌های بزرگ MoE که روی سخت‌افزار سازگار با Vulkan اجرا می‌شوند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

آخرین به‌روزرسانی: 2026-09-29
