Oossa

llama.cpp, CUDA’da daha hızlı top‑k seçimi sunuyor

Açık kaynaklı Llama.cpp kütüphanesi, CUDA’da top‑k seçimi için artık radix-select algoritmasını kullanıyor. Büyük ölçekli bir testte çalışma süresi 5.76 s’den 0.94 s’ye indi.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

llama.cpp projesi, 8 Ekim 2026’da yeni bir sürüm (b11513) yayımladı. Bu sürüm, CUDA’da satır başına çalışan önceki top‑k yordamının yerini satırlar üzerinde grid kullanan radix-select yöntemiyle değiştiriyor. Qwen‑4‑exp modelinde 34,816 token ile yapılan testte değişiklik, top‑k çağrılarını 1,671,253 başlatmadan (5,761.8 ms) 2,329 başlatmaya (941.8 ms) düşürüyor. Güncelleme ayrıca matris biçimine göre en uygun top‑k algoritmasını otomatik seçiyor ve bitonic ile radix yollarının eşik değerlerini iyileştiriyor.

Neden önemli

Nvidia GPU’larda büyük dil modelleri çalıştıran geliştiriciler, top‑k işlemlerinde yaklaşık altı kat hızlanma elde ederek çıkarım ve eğitim süreçlerini hızlandırabilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.