llama.cpp लाइब्रेरी का नया संस्करण (b11374) 3 अक्टूबर 2026 को जारी हुआ। इसमें OpenVINO बैकएंड को संस्करण 2026.4.1 पर अपग्रेड किया गया है, नया conv-fusion जोड़ा गया है, GPU बफ़र की गड़बड़ियां ठीक की गई हैं और mixture-of-experts (MoE) मॉडल के लिए axis हैंडलिंग सुधारी गई है। इन बदलावों से fused MoE मॉडल में टोकन जनरेट होने की रफ़्तार बढ़ती है और कुछ Intel GPU पर क्रैश होने से बचाव होता है।
यह क्यों मायने रखता है
Intel GPU पर llama.cpp चलाने वाले डेवलपर अब OpenVINO का इस्तेमाल बेहतर रफ़्तार और कम क्रैश के साथ कर सकते हैं।