# llama.cpp अपडेट से MoE मैट्रिक्स गुणा अधिक कुशल

> 30 सितंबर, 2026 के रिलीज़ में Vulkan टाइल चयन को बेहतर बनाया गया है, जिससे Mixture-of-Experts मॉडल में बेकार काम कम होता है।

Oossa · 2026-09-29 · https://oossa.com/hi/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

ओपन-सोर्स llama.cpp लाइब्रेरी में MoE-अनुकूल मैट्रिक्स गुणा के लिए Vulkan सुधार जोड़ा गया है। इस बदलाव में mat_mul_id ऑपरेशन के लिए टाइल आकार चुनने का तरीका बदला गया है, ताकि वह हर एक्सपर्ट के लिए सक्रिय पंक्तियों की वास्तविक संख्या के अनुरूप हो। 30 अरब पैरामीटर वाले मॉडल पर किए गए परीक्षण में इस सुधार से GPU का वह निष्क्रिय काम कम हुआ, जो रनटाइम का 55% ले रहा था।

## तथ्य

- रिलीज़ संस्करण b11265, 30 सितंबर, 2026 को जारी किया गया
- Sarvam 30B परीक्षण में प्रदर्शन का अपव्यय 55% से घटकर लगभग शून्य रह गया

## यह क्यों मायने रखता है

GPU का कम निष्क्रिय समय मतलब Vulkan-संगत हार्डवेयर पर चलने वाले बड़े MoE मॉडल तेज़ी से अनुमान दे सकेंगे।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

अंतिम अपडेट: 2026-09-29
