پروژه متنباز llama.cpp در 11 اکتبر 2026 نسخه b11558 را منتشر کرد. این بهروزرسانی اشکالی را رفع میکند که باعث میشد کرنلهای OpenCL هنگام استفاده از وزنهای کوانتیزهشده Q4_K از محدودیت تصویر دستگاه فراتر بروند. همچنین برای دستگاههایی که به این محدودیت میرسند، مسیر جایگزینی اضافه میکند و محاسبات broadcasting و RMS-norm را در کرنلهای Q4_0 اصلاح میکند. این تغییرات با همکاری Hongqiang Wang از Qualcomm انجام شدهاند.
چرا مهم است
توسعهدهندگانی که از llama.cpp روی GPU استفاده میکنند، حالا میتوانند مدلهای کوانتیزهشده Q4_K را روی سختافزارهای بیشتری بدون کرش اجرا کنند.