ggml‑org टीम ने 8 अक्टूबर, 2026 को llama.cpp का संस्करण b11507 जारी किया। इस अपडेट में mixture-of-experts (MoE) कैश को कई GPU पर फैलाने का सपोर्ट जोड़ा गया है। इससे डेवलपर बड़े MoE मॉडल चला सकते हैं, जिन्हें एक ही कार्ड पर फिट करना संभव नहीं होता। इस रिलीज़ में macOS, iOS और CUDA 12.8 सपोर्ट समेत Linux के कई कॉन्फ़िगरेशन के लिए नए बाइनरी पैकेज भी शामिल हैं।
यह क्यों मायने रखता है
डेवलपर अब कई GPU वाले सिस्टम पर बड़े और अधिक सक्षम AI मॉडल चला सकते हैं, जिससे निजी हार्डवेयर पर किए जा सकने वाले कामों का दायरा बढ़ता है।