# llama.cpp v0.1.11534 में CUDA कॉपी का काम घटा

> ओपन-सोर्स LLaMA इन्फ़रेंस लाइब्रेरी GPU मेमोरी में गैर-ज़रूरी डेटा कॉपी हटाती है, जिससे कुछ कामों में अतिरिक्त बोझ कम होगा।

Oossa · 2026-10-09 · https://oossa.com/hi/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

ggml-org टीम ने 2026-10-09 को llama.cpp का b11534 संस्करण जारी किया। इस अपडेट में स्टेट-स्नैपशॉट की कॉपी को रिकरेंट कैश में शामिल किया गया है और K = 1 होने पर अतिरिक्त CUDA कॉपी हटा दी गई हैं। यह नॉन-स्पेक्युलेटिव डिकोडिंग का मामला है। यह बदलाव सिर्फ CUDA बैकएंड तक सीमित है, इसलिए CPU और Vulkan बिल्ड में कोई बदलाव नहीं हुआ है। macOS, iOS और Ubuntu के कई संस्करणों के लिए पहले से बने बाइनरी डाउनलोड के लिए उपलब्ध हैं।

CUDA संस्करण इस्तेमाल करने वालों को GPU मेमोरी में डेटा का आवागमन थोड़ा कम दिखना चाहिए, जिससे समर्थित हार्डवेयर पर गति बेहतर हो सकती है।

## तथ्य

- रिलीज़ संस्करण b11534, 2026-10-09 को प्रकाशित हुआ
- CUDA कॉपी हटाने का बदलाव K = 1 (नॉन-स्पेक-डिकोडिंग) स्थिति में लागू होता है

## यह क्यों मायने रखता है

CUDA उपयोगकर्ताओं को तेज़ इन्फ़रेंस मिल सकता है, क्योंकि अब लाइब्रेरी GPU पर कम डेटा का आवागमन करती है।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

अंतिम अपडेट: 2026-10-09
