llama.cpp प्रोजेक्ट ने Oct 8, 2026 को b11509 वर्ज़न जारी किया। इसमें CUDA गार्ड की वह गड़बड़ी ठीक की गई है, जो CCCL वर्ज़न 4.x को गलती से पुराना मान रहा था और argsort ऑपरेशन की परफ़ॉर्मेंस चुपचाप घटा रहा था। इस सुधार में अलग-अलग घटकों की जाँच की जगह एक ही पैक्ड इंटीजर से तुलना की गई है, जिससे तेज़ strided-iterator पाथ फिर से काम करने लगा है। इस बदलाव का RTX 4070 और CUDA 13.4 पर परीक्षण किया गया और यह सभी बैकएंड टेस्ट में सफल रहा।
यह क्यों मायने रखता है
आधुनिक CUDA सेटअप पर llama.cpp इस्तेमाल करने वाले डेवलपर बिना कोड बदले तेज़ sorting performance पा सकेंगे।