ggml-org टीम ने 8 अक्टूबर 2026 को llama.cpp का संस्करण b11510 जारी किया। इसमें CUDA के लिए एक लूप वाला PAD कर्नेल जोड़ा गया है, जिससे लाइब्रेरी 65,000 से अधिक पंक्तियों या स्लाइस वाले टेंसर प्रोसेस कर सकती है। इस रिलीज़ में Apple Silicon, Intel macOS, iOS और Ubuntu के कई बिल्ड (CPU, Vulkan और CUDA 12.8) के लिए पहले से तैयार बाइनरी भी शामिल हैं। कोड और अटेस्टेशन GitHub पेज से उपलब्ध हैं।
यह क्यों मायने रखता है
डेवलपर अब NVIDIA GPU पर पिछली पंक्ति-सीमा से टकराए बिना बड़े भाषा मॉडल चला सकते हैं।