ggml‑org टीम ने 10 Oct 2026 को llama.cpp का संस्करण b11540 जारी किया। इस अपडेट में arithmetic decoding और weight reordering का इस्तेमाल करते हुए MXFP4 mixture‑of‑experts (MoE) मॉडल को तेज़ चलाने के लिए SYCL सपोर्ट जोड़ा गया है। इसमें macOS Apple Silicon, Intel, iOS और Ubuntu के कई वेरिएंट (CPU, Vulkan और CUDA) के लिए पहले से तैयार बाइनरी भी शामिल हैं। बदलाव GitHub पर b11540 टैग के तहत सूचीबद्ध हैं।
यह क्यों मायने रखता है
अब डेवलपर SYCL सपोर्ट वाले GPU पर बड़े MoE मॉडल तेज़ी से चला सकते हैं। इससे llama.cpp इस्तेमाल करने वालों के लिए हार्डवेयर के विकल्प बढ़ते हैं।