# تحديث llama.cpp يحسّن كفاءة ضرب المصفوفات في MoE

> يعدّل إصدار 30 سبتمبر 2026 اختيار أحجام البلاطات في Vulkan، ما يقلل العمل المهدور في نماذج مزيج الخبراء.

Oossa · 2026-09-29 · https://oossa.com/ar/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

أضافت مكتبة llama.cpp مفتوحة المصدر إصلاحًا في Vulkan لضرب المصفوفات المراعي لبنية MoE. ويعدّل التغيير طريقة اختيار الشيفرة لأحجام البلاطات في عملية mat_mul_id، بحيث تتوافق مع العدد الفعلي للصفوف النشطة لدى كل خبير. وفي اختبار أُجري على نموذج يضم 30 مليار مُعامل، قلّل الإصلاح وقت عمل وحدة GPU الخامل، الذي كان يشكل 55% من مدة التشغيل.

## الحقائق

- نُشر الإصدار b11265 في 30 سبتمبر 2026
- تراجع هدر الأداء من 55% إلى ما يقارب الصفر في اختبار Sarvam 30B

## لماذا يهم

يعني تقليل وقت خمول وحدة GPU استدلالًا أسرع لنماذج MoE الكبيرة التي تعمل على أجهزة متوافقة مع Vulkan.

## المصادر والمراجع

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

آخر تحديث: 2026-09-29
