ggml-org टीम ने 8 Oct 2026 को llama.cpp का रिलीज़ b11499 जारी किया। इस अपडेट में CUDA बैकएंड के roll ऑपरेशन के लिए byte strides का इस्तेमाल किया गया है, जिससे GPU non-contiguous डेटा को सही ढंग से संभाल सकता है। रिलीज़ में Apple Silicon, Intel macOS, iOS और Ubuntu के कई बिल्ड (CPU, Vulkan और CUDA 12) के नए बाइनरी भी शामिल हैं। सभी फ़ाइलें GitHub के रिलीज़ पेज से डाउनलोड की जा सकती हैं।
यह क्यों मायने रखता है
डेवलपर बिना त्रुटियों के ज़्यादा GPU सेटअप पर llama.cpp चला सकते हैं, जिससे डेस्कटॉप और सर्वर पर स्थानीय LLM का इस्तेमाल बढ़ेगा।