# llama.cpp में अब कई GPU पर MoE कैश का सपोर्ट

> ओपन-सोर्स Llama.cpp लाइब्रेरी की मदद से अब यूज़र कई GPU पर mixture-of-experts मॉडल चला सकते हैं।

Oossa · 2026-10-08 · https://oossa.com/hi/llama-cpp-adds-multi-gpu-moe-cache-support

ggml‑org टीम ने 8 अक्टूबर, 2026 को llama.cpp का संस्करण b11507 जारी किया। इस अपडेट में mixture-of-experts (MoE) कैश को कई GPU पर फैलाने का सपोर्ट जोड़ा गया है। इससे डेवलपर बड़े MoE मॉडल चला सकते हैं, जिन्हें एक ही कार्ड पर फिट करना संभव नहीं होता। इस रिलीज़ में macOS, iOS और CUDA 12.8 सपोर्ट समेत Linux के कई कॉन्फ़िगरेशन के लिए नए बाइनरी पैकेज भी शामिल हैं।

## तथ्य

- संस्करण b11507 2026-10-08 को जारी हुआ
- कई GPU पर MoE कैश का सपोर्ट जोड़ा गया

## यह क्यों मायने रखता है

डेवलपर अब कई GPU वाले सिस्टम पर बड़े और अधिक सक्षम AI मॉडल चला सकते हैं, जिससे निजी हार्डवेयर पर किए जा सकने वाले कामों का दायरा बढ़ता है।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

अंतिम अपडेट: 2026-10-08
