ओपन-सोर्स llama.cpp लाइब्रेरी में MoE-अनुकूल मैट्रिक्स गुणा के लिए Vulkan सुधार जोड़ा गया है। इस बदलाव में mat_mul_id ऑपरेशन के लिए टाइल आकार चुनने का तरीका बदला गया है, ताकि वह हर एक्सपर्ट के लिए सक्रिय पंक्तियों की वास्तविक संख्या के अनुरूप हो। 30 अरब पैरामीटर वाले मॉडल पर किए गए परीक्षण में इस सुधार से GPU का वह निष्क्रिय काम कम हुआ, जो रनटाइम का 55% ले रहा था।
यह क्यों मायने रखता है
GPU का कम निष्क्रिय समय मतलब Vulkan-संगत हार्डवेयर पर चलने वाले बड़े MoE मॉडल तेज़ी से अनुमान दे सकेंगे।