Oossaالذكاء الاصطناعي يتطور بسرعة. نحن نشرحه ببساطة.

تحديث llama.cpp يحسّن كفاءة ضرب المصفوفات في MoE

يعدّل إصدار 30 سبتمبر 2026 اختيار أحجام البلاطات في Vulkan، ما يقلل العمل المهدور في نماذج مزيج الخبراء.

خبر موجزOossa1 دقائق قراءة

أضافت مكتبة llama.cpp مفتوحة المصدر إصلاحًا في Vulkan لضرب المصفوفات المراعي لبنية MoE. ويعدّل التغيير طريقة اختيار الشيفرة لأحجام البلاطات في عملية mat_mul_id، بحيث تتوافق مع العدد الفعلي للصفوف النشطة لدى كل خبير. وفي اختبار أُجري على نموذج يضم 30 مليار مُعامل، قلّل الإصلاح وقت عمل وحدة GPU الخامل، الذي كان يشكل 55% من مدة التشغيل.

لماذا يهم

يعني تقليل وقت خمول وحدة GPU استدلالًا أسرع لنماذج MoE الكبيرة التي تعمل على أجهزة متوافقة مع Vulkan.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.

المصادر والمراجع

#المصدرالجهة الناشرةالتاريخالخلاصة
1ggml-org/llama.cpp b11265 ↗llama.cpp29‏/09‏/2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 مصادر

آخر تحديث: ·Markdown·llms.txt