پروژه llama.cpp وصلهای منتشر کرده که شیوه بارگذاری اعداد اعشاری ۳۲ بیتی (F32) در کد Vulkan را تغییر میدهد. در پردازندههای گرافیکی اینتل، بارگذاری همزمان دو عدد اعشاری از بارگذاری تکبهتک سریعتر است؛ به همین دلیل، منطق جدید در روتین mul_mat_vec از بارگذاری همتراز با ۲ استفاده میکند. این تغییر همچنین بررسی همترازیِ جامانده را اضافه میکند. نتایج بنچمارک روی برد آزمایشی B60 برای برخی اندازههای ماتریس، سرعتی تا ۱٫۶۳ ترافلاپس را نشان میدهد که نسبت به نسخه قبلی افزایش محسوسی است.
چرا مهم است
محاسبات سریعتر روی GPU یعنی استنتاج سریعتر مدلهای زبانی بزرگ برای کاربرانی که llama.cpp را روی سختافزار اینتل اجرا میکنند.