llama.cpp projesi, 8 Ekim 2026’da yeni bir sürüm (b11513) yayımladı. Bu sürüm, CUDA’da satır başına çalışan önceki top‑k yordamının yerini satırlar üzerinde grid kullanan radix-select yöntemiyle değiştiriyor. Qwen‑4‑exp modelinde 34,816 token ile yapılan testte değişiklik, top‑k çağrılarını 1,671,253 başlatmadan (5,761.8 ms) 2,329 başlatmaya (941.8 ms) düşürüyor. Güncelleme ayrıca matris biçimine göre en uygun top‑k algoritmasını otomatik seçiyor ve bitonic ile radix yollarının eşik değerlerini iyileştiriyor.
Neden önemli
Nvidia GPU’larda büyük dil modelleri çalıştıran geliştiriciler, top‑k işlemlerinde yaklaşık altı kat hızlanma elde ederek çıkarım ve eğitim süreçlerini hızlandırabilir.