Oossa

llama.cpp में Vulkan के लिए डुप्लिकेट रो वाली नई ऑप्टिमाइज़ेशन

ओपन-सोर्स LLaMA इंफरेंस लाइब्रेरी अब GPU पर रो दोहरने पर अनावश्यक गणनाएं छोड़ देती है, जिससे Vulkan डिवाइस पर रफ्तार बढ़ती है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

llama.cpp प्रोजेक्ट ने 2026‑10‑11 को संस्करण b11554 जारी किया। इस अपडेट में Vulkan के लिए ऐसे सुधार जोड़े गए हैं, जो मैट्रिक्स गुणा के दौरान डुप्लिकेट रो ID पहचानकर उन्हें बार-बार प्रोसेस करने के बजाय पहले ही संभालते हैं। साथ ही, “hoist row ids” ऑप्टिमाइज़ेशन को बेहतर बनाया गया है, ताकि यह हमेशा चले और कई कॉम्पैक्ट टाइल बना सके। इन बदलावों से GPU कम वर्क-ग्रुप लॉन्च कर सकता है और जहां संभव हो, जल्दी काम रोक सकता है।

यह क्यों मायने रखता है

llama.cpp इस्तेमाल करने वाले GPU यूज़रों को तेज़ इंफरेंस मिल सकता है, क्योंकि लाइब्रेरी अब एक जैसी गणनाएं दोहराने से बचती है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।