llama.cpp प्रोजेक्ट ने 2026‑10‑11 को संस्करण b11554 जारी किया। इस अपडेट में Vulkan के लिए ऐसे सुधार जोड़े गए हैं, जो मैट्रिक्स गुणा के दौरान डुप्लिकेट रो ID पहचानकर उन्हें बार-बार प्रोसेस करने के बजाय पहले ही संभालते हैं। साथ ही, “hoist row ids” ऑप्टिमाइज़ेशन को बेहतर बनाया गया है, ताकि यह हमेशा चले और कई कॉम्पैक्ट टाइल बना सके। इन बदलावों से GPU कम वर्क-ग्रुप लॉन्च कर सकता है और जहां संभव हो, जल्दी काम रोक सकता है।
यह क्यों मायने रखता है
llama.cpp इस्तेमाल करने वाले GPU यूज़रों को तेज़ इंफरेंस मिल सकता है, क्योंकि लाइब्रेरी अब एक जैसी गणनाएं दोहराने से बचती है।