پروژهٔ ggml‑org/llama.cpp نسخهٔ b11372 را در Oct 3 2026 منتشر کرد. در این بهروزرسانی، ایندکسر Qwen4exp بازنویسی شده است تا هر سر بهطور جداگانه امتیاز خود را محاسبه کند و نتایج را در همان محل بنویسد. این تغییر حافظهٔ موردنیاز برای بافرهای امتیاز ایندکسر را که در نمودارهای دارای متن طولانی بیشترین مصرف حافظه را داشتند، به نصف میرساند. این تغییر سرعت محاسبات را کاهش نمیدهد و پشتیبانی از ایندکسر جدید lightning را نیز به بکاندهای CUDA، Metal و Vulkan اضافه میکند.
چرا مهم است
توسعهدهندگانی که مدلهای زبانی بزرگ را با متنهای طولانی اجرا میکنند، میتوانند با همان سختافزار از ورودیهای بزرگتری استفاده کنند.