OossaAI तेज़ी से विकसित हो रहा है। हम इसे आसान भाषा में समझाते हैं।

llama.cpp अपडेट से MoE मैट्रिक्स गुणा अधिक कुशल

30 सितंबर, 2026 के रिलीज़ में Vulkan टाइल चयन को बेहतर बनाया गया है, जिससे Mixture-of-Experts मॉडल में बेकार काम कम होता है।

संक्षिप्तOossa1 मिनट पढ़ना

ओपन-सोर्स llama.cpp लाइब्रेरी में MoE-अनुकूल मैट्रिक्स गुणा के लिए Vulkan सुधार जोड़ा गया है। इस बदलाव में mat_mul_id ऑपरेशन के लिए टाइल आकार चुनने का तरीका बदला गया है, ताकि वह हर एक्सपर्ट के लिए सक्रिय पंक्तियों की वास्तविक संख्या के अनुरूप हो। 30 अरब पैरामीटर वाले मॉडल पर किए गए परीक्षण में इस सुधार से GPU का वह निष्क्रिय काम कम हुआ, जो रनटाइम का 55% ले रहा था।

यह क्यों मायने रखता है

GPU का कम निष्क्रिय समय मतलब Vulkan-संगत हार्डवेयर पर चलने वाले बड़े MoE मॉडल तेज़ी से अनुमान दे सकेंगे।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।

स्रोत और संदर्भ

#स्रोतप्रकाशकतारीखमुख्य बात
1ggml-org/llama.cpp b11265 ↗llama.cpp29 सित॰ 2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 स्रोत

अंतिम अपडेट: ·Markdown·llms.txt