پروژهٔ llama.cpp نسخهٔ b11482 را در Oct 8 2026 منتشر کرد. این نسخه کرنلهای CUDA FWHT را اضافه میکند که برای عرض بلوکهای بیش از 512 کار میکنند و پشتیبانی از عرضهای 1,024 تا 8,192 را برای دادههای FP32 و FP16 گسترش میدهند. این تغییر از زیرساخت F16 موجود استفاده میکند و آزمونها را روی یک پردازندهٔ گرافیکی A10 با موفقیت پشت سر میگذارد. کرنلهای موجود با عرض warp (64 تا 512) بدون تغییر باقی ماندهاند.
چرا مهم است
کاربران GPU اکنون میتوانند با llama.cpp ضرب ماتریسهایی با عرض بزرگتر را سریعتر اجرا کنند.