llama.cpp प्रोजेक्ट ने 8 Oct 2026 को संस्करण b11482 जारी किया। इसमें ऐसे CUDA FWHT कर्नेल जोड़े गए हैं जो 512 से अधिक ब्लॉक चौड़ाइयों पर काम करते हैं और FP32 तथा FP16, दोनों डेटा के लिए 1,024–8,192 तक सपोर्ट देते हैं। इस बदलाव में मौजूदा F16 इन्फ्रास्ट्रक्चर का दोबारा इस्तेमाल किया गया है और A10 GPU पर परीक्षण सफल रहे हैं। पहले से मौजूद वॉर्प-चौड़ाई वाले कर्नेल (64–512) में कोई बदलाव नहीं किया गया है।
यह क्यों मायने रखता है
अब GPU उपयोगकर्ता llama.cpp के साथ बड़ी चौड़ाई वाले मैट्रिक्स गुणन तेज़ी से चला सकते हैं।