پروژه llama.cpp نسخه جدیدی (b11513) را در Oct 8 2026 منتشر کرد. در این نسخه، روال قبلی CUDA top‑k که برای هر ردیف جداگانه اجرا میشد، با روش radix select روی شبکهای از ردیفها جایگزین شده است. در مدل Qwen‑4‑exp و با 34,816 توکن، این تغییر تعداد فراخوانیهای top‑k را از 1,671,253 اجرا (5,761.8 ms) به 2,329 اجرا (941.8 ms) کاهش میدهد. این بهروزرسانی همچنین انتخاب خودکار بهترین الگوریتم top‑k را بر اساس شکل ماتریس اضافه میکند و آستانههای مسیرهای bitonic و radix را بهبود میدهد.
چرا مهم است
توسعهدهندگانی که مدلهای زبانی بزرگ را روی پردازندههای گرافیکی Nvidia اجرا میکنند، میتوانند انتظار داشته باشند عملیات top‑k حدود شش برابر سریعتر انجام شود و در نتیجه استنتاج و آموزش سرعت بگیرد.