أصدر مشروع llama.cpp تصحيحًا يغيّر طريقة تحميل شيفرة Vulkan للقيم العشرية ذات 32 بت (F32). ففي وحدات Intel GPU، يكون تحميل قيمتين معًا أسرع من تحميلهما واحدة تلو الأخرى، لذا تستخدم الآلية الجديدة تحميلًا بمحاذاة 2 ضمن الروتين mul_mat_vec. ويضيف التغيير أيضًا فحصًا للمحاذاة كان مفقودًا. وأظهرت الاختبارات المعيارية على لوحة الاختبار B60 أداءً يصل إلى 1.63 TFLOPS لبعض أحجام المصفوفات، في تحسن ملحوظ مقارنة بالإصدار السابق.
لماذا يهم
تعني الحسابات الأسرع على GPU استدلالًا أسرع لنماذج اللغة الكبيرة للمستخدمين الذين يشغّلون llama.cpp على أجهزة Intel.