llama.cpp प्रोजेक्ट ने 8 Oct 2026 को नया वर्ज़न (b11513) जारी किया। इसमें CUDA top‑k की पिछली per-row प्रक्रिया की जगह grid-over-rows radix select का इस्तेमाल किया गया है। Qwen‑4‑exp मॉडल पर 34,816 tokens के साथ इस बदलाव से top‑k कॉल की संख्या 1,671,253 लॉन्च (5,761.8 ms) से घटकर 2,329 लॉन्च (941.8 ms) रह गई। अपडेट में matrix के आकार के आधार पर सबसे अच्छा top‑k एल्गोरिदम अपने-आप चुनने की सुविधा भी जोड़ी गई है और bitonic तथा radix तरीकों के लिए सीमाएं बेहतर की गई हैं।
यह क्यों मायने रखता है
Nvidia GPU पर बड़े भाषा मॉडल चलाने वाले डेवलपर top‑k ऑपरेशन करीब छह गुना तेज़ होने की उम्मीद कर सकते हैं, जिससे inference और training की रफ्तार बढ़ेगी।