Oossa

llama.cpp v0.1.11534 में CUDA कॉपी का काम घटा

ओपन-सोर्स LLaMA इन्फ़रेंस लाइब्रेरी GPU मेमोरी में गैर-ज़रूरी डेटा कॉपी हटाती है, जिससे कुछ कामों में अतिरिक्त बोझ कम होगा।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

ggml-org टीम ने 2026-10-09 को llama.cpp का b11534 संस्करण जारी किया। इस अपडेट में स्टेट-स्नैपशॉट की कॉपी को रिकरेंट कैश में शामिल किया गया है और K = 1 होने पर अतिरिक्त CUDA कॉपी हटा दी गई हैं। यह नॉन-स्पेक्युलेटिव डिकोडिंग का मामला है। यह बदलाव सिर्फ CUDA बैकएंड तक सीमित है, इसलिए CPU और Vulkan बिल्ड में कोई बदलाव नहीं हुआ है। macOS, iOS और Ubuntu के कई संस्करणों के लिए पहले से बने बाइनरी डाउनलोड के लिए उपलब्ध हैं।

CUDA संस्करण इस्तेमाल करने वालों को GPU मेमोरी में डेटा का आवागमन थोड़ा कम दिखना चाहिए, जिससे समर्थित हार्डवेयर पर गति बेहतर हो सकती है।

यह क्यों मायने रखता है

CUDA उपयोगकर्ताओं को तेज़ इन्फ़रेंस मिल सकता है, क्योंकि अब लाइब्रेरी GPU पर कम डेटा का आवागमन करती है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।