Oossa

llama.cpp में CUDA top‑k चयन हुआ तेज़

ओपन-सोर्स Llama.cpp लाइब्रेरी अब CUDA top‑k के लिए radix-select एल्गोरिदम का इस्तेमाल करती है। बड़े परीक्षण में रनटाइम 5.76 s से घटकर 0.94 s रह गया।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

llama.cpp प्रोजेक्ट ने 8 Oct 2026 को नया वर्ज़न (b11513) जारी किया। इसमें CUDA top‑k की पिछली per-row प्रक्रिया की जगह grid-over-rows radix select का इस्तेमाल किया गया है। Qwen‑4‑exp मॉडल पर 34,816 tokens के साथ इस बदलाव से top‑k कॉल की संख्या 1,671,253 लॉन्च (5,761.8 ms) से घटकर 2,329 लॉन्च (941.8 ms) रह गई। अपडेट में matrix के आकार के आधार पर सबसे अच्छा top‑k एल्गोरिदम अपने-आप चुनने की सुविधा भी जोड़ी गई है और bitonic तथा radix तरीकों के लिए सीमाएं बेहतर की गई हैं।

यह क्यों मायने रखता है

Nvidia GPU पर बड़े भाषा मॉडल चलाने वाले डेवलपर top‑k ऑपरेशन करीब छह गुना तेज़ होने की उम्मीद कर सकते हैं, जिससे inference और training की रफ्तार बढ़ेगी।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।