# llama.cpp, CUDA’da daha hızlı top‑k seçimi sunuyor

> Açık kaynaklı Llama.cpp kütüphanesi, CUDA’da top‑k seçimi için artık radix-select algoritmasını kullanıyor. Büyük ölçekli bir testte çalışma süresi 5.76 s’den 0.94 s’ye indi.

Oossa · 2026-10-08 · https://oossa.com/tr/llama-cpp-adds-faster-cuda-top-k-selection

llama.cpp projesi, 8 Ekim 2026’da yeni bir sürüm (b11513) yayımladı. Bu sürüm, CUDA’da satır başına çalışan önceki top‑k yordamının yerini satırlar üzerinde grid kullanan radix-select yöntemiyle değiştiriyor. Qwen‑4‑exp modelinde 34,816 token ile yapılan testte değişiklik, top‑k çağrılarını 1,671,253 başlatmadan (5,761.8 ms) 2,329 başlatmaya (941.8 ms) düşürüyor. Güncelleme ayrıca matris biçimine göre en uygun top‑k algoritmasını otomatik seçiyor ve bitonic ile radix yollarının eşik değerlerini iyileştiriyor.

## Gerçekler

- Yayımlanma tarihi: 8 Ekim 2026 – "PUBLISHED: Thu Oct 08 2026"
- Qwen‑4‑exp modelindeki çalışma süresi düşüşü: 5,761.8 ms’den 941.8 ms’ye

## Neden önemli

Nvidia GPU’larda büyük dil modelleri çalıştıran geliştiriciler, top‑k işlemlerinde yaklaşık altı kat hızlanma elde ederek çıkarım ve eğitim süreçlerini hızlandırabilir.

## Kaynaklar ve referanslar

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Son güncelleme: 2026-10-08
