Oossa

llama.cpp में MoE एक्सपर्ट्स के लिए GPU कैश

ओपन-सोर्स llama.cpp लाइब्रेरी अब मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) डेटा को होस्ट मेमोरी में रखे GPU कैश में स्टोर करती है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: अंतिम अपडेट: 1 मिनट पढ़ना

ggml‑org टीम ने 2026‑10‑08 को llama.cpp का संस्करण b11480 जारी किया। इस अपडेट में MoE एक्सपर्ट्स के लिए होस्ट मेमोरी में रखा जाने वाला GPU कैश जोड़ा गया है, जिससे बड़े मॉडल GPU पर तेज़ी से चल सकते हैं। इस बदलाव पर Claude की सहायता का उल्लेख है और इसमें नया llama_moe_cache_ptr API इस्तेमाल किया गया है। macOS, iOS और Ubuntu के कई कॉन्फ़िगरेशन के लिए पहले से बने बाइनरी डाउनलोड के लिए उपलब्ध हैं।

यह क्यों मायने रखता है

अब डेवलपर उपभोक्ता-स्तर के GPU पर MoE मॉडल अधिक कुशलता से चला सकते हैं, जिससे AI परियोजनाओं के लिए हार्डवेयर की लागत कम होती है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।