ggml-org टीम ने 8 Oct 2026 को llama.cpp का संस्करण b11493 जारी किया। इस अपडेट में grouped Mixture-of-Experts (MoE) XMX GEMM का SYCL कार्यान्वयन जोड़ा गया है। यह बड़े भाषा मॉडल में इस्तेमाल होने वाला मैट्रिक्स गुणन ऑपरेशन है। रिलीज़ में macOS, iOS और Ubuntu (CPU, Vulkan और CUDA) के लिए पहले से बनी बाइनरी भी शामिल हैं।
यह क्यों मायने रखता है
अब डेवलपर SYCL-संगत GPU पर MoE-आधारित मॉडल चला सकते हैं, जिससे ओपन-सोर्स LLM वर्कलोड के लिए हार्डवेयर के विकल्प बढ़ते हैं।