# llama.cpp में MoE एक्सपर्ट्स के लिए GPU कैश

> ओपन-सोर्स llama.cpp लाइब्रेरी अब मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) डेटा को होस्ट मेमोरी में रखे GPU कैश में स्टोर करती है।

Oossa · 2026-10-08 · https://oossa.com/hi/llama-cpp-adds-gpu-cache-for-moe-experts

ggml‑org टीम ने 2026‑10‑08 को llama.cpp का संस्करण b11480 जारी किया। इस अपडेट में MoE एक्सपर्ट्स के लिए होस्ट मेमोरी में रखा जाने वाला GPU कैश जोड़ा गया है, जिससे बड़े मॉडल GPU पर तेज़ी से चल सकते हैं। इस बदलाव पर Claude की सहायता का उल्लेख है और इसमें नया llama_moe_cache_ptr API इस्तेमाल किया गया है। macOS, iOS और Ubuntu के कई कॉन्फ़िगरेशन के लिए पहले से बने बाइनरी डाउनलोड के लिए उपलब्ध हैं।

## तथ्य

- रिलीज़ संस्करण: b11480
- रिलीज़ की तारीख: 2026‑10‑08

## यह क्यों मायने रखता है

अब डेवलपर उपभोक्ता-स्तर के GPU पर MoE मॉडल अधिक कुशलता से चला सकते हैं, जिससे AI परियोजनाओं के लिए हार्डवेयर की लागत कम होती है।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

अंतिम अपडेट: 2026-10-08
