# llama.cpp में CUDA top‑k चयन हुआ तेज़

> ओपन-सोर्स Llama.cpp लाइब्रेरी अब CUDA top‑k के लिए radix-select एल्गोरिदम का इस्तेमाल करती है। बड़े परीक्षण में रनटाइम 5.76 s से घटकर 0.94 s रह गया।

Oossa · 2026-10-08 · https://oossa.com/hi/llama-cpp-adds-faster-cuda-top-k-selection

llama.cpp प्रोजेक्ट ने 8 Oct 2026 को नया वर्ज़न (b11513) जारी किया। इसमें CUDA top‑k की पिछली per-row प्रक्रिया की जगह grid-over-rows radix select का इस्तेमाल किया गया है। Qwen‑4‑exp मॉडल पर 34,816 tokens के साथ इस बदलाव से top‑k कॉल की संख्या 1,671,253 लॉन्च (5,761.8 ms) से घटकर 2,329 लॉन्च (941.8 ms) रह गई। अपडेट में matrix के आकार के आधार पर सबसे अच्छा top‑k एल्गोरिदम अपने-आप चुनने की सुविधा भी जोड़ी गई है और bitonic तथा radix तरीकों के लिए सीमाएं बेहतर की गई हैं।

## तथ्य

- जारी होने की तारीख: 8 Oct 2026 – "PUBLISHED: Thu Oct 08 2026"
- Qwen‑4‑exp पर रनटाइम में कमी: 5,761.8 ms से 941.8 ms तक

## यह क्यों मायने रखता है

Nvidia GPU पर बड़े भाषा मॉडल चलाने वाले डेवलपर top‑k ऑपरेशन करीब छह गुना तेज़ होने की उम्मीद कर सकते हैं, जिससे inference और training की रफ्तार बढ़ेगी।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

अंतिम अपडेट: 2026-10-08
