Oossaالذكاء الاصطناعي يتطور بسرعة. نحن نشرحه ببساطة.

llama.cpp يضيف تحميل F32 بمحاذاة 2 لمعالجات Intel Vulkan

يعزز التحديث سرعة ضرب المصفوفات على وحدات Intel GPU عبر تحميل قيمتين عشريتين في كل مرة.

خبر موجزOossa1 دقائق قراءة

أصدر مشروع llama.cpp تصحيحًا يغيّر طريقة تحميل شيفرة Vulkan للقيم العشرية ذات 32 بت (F32). ففي وحدات Intel GPU، يكون تحميل قيمتين معًا أسرع من تحميلهما واحدة تلو الأخرى، لذا تستخدم الآلية الجديدة تحميلًا بمحاذاة 2 ضمن الروتين mul_mat_vec. ويضيف التغيير أيضًا فحصًا للمحاذاة كان مفقودًا. وأظهرت الاختبارات المعيارية على لوحة الاختبار B60 أداءً يصل إلى 1.63 TFLOPS لبعض أحجام المصفوفات، في تحسن ملحوظ مقارنة بالإصدار السابق.

لماذا يهم

تعني الحسابات الأسرع على GPU استدلالًا أسرع لنماذج اللغة الكبيرة للمستخدمين الذين يشغّلون llama.cpp على أجهزة Intel.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.

المصادر والمراجع

#المصدرالجهة الناشرةالتاريخالخلاصة
1ggml-org/llama.cpp b11266 ↗llama.cpp29‏/09‏/2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30‏/09‏/2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 مصادر

آخر تحديث: ·Markdown·llms.txt