Oossa

llama.cpp अपडेट से इंडेक्सर की मेमोरी आधी हुई

b11372 रिलीज़ में Qwen4exp इंडेक्सर को इस तरह बदला गया है कि लंबा कॉन्टेक्स्ट चलाने पर काफी कम RAM लगेगी और रफ्तार भी कम नहीं होगी।

संक्षिप्तOossaOossa द्वारा प्रकाशित: 1 मिनट पढ़ना

ggml‑org/llama.cpp प्रोजेक्ट ने 3 अक्टूबर 2026 को b11372 संस्करण जारी किया। इस अपडेट में Qwen4exp इंडेक्सर को फिर से लिखा गया है, ताकि हर हेड अलग-अलग अपना स्कोर निकाले और नतीजे सीधे उसी जगह लिखे जाएँ। इससे इंडेक्सर के स्कोर बफ़र के लिए जरूरी मेमोरी आधी रह जाती है। लंबे कॉन्टेक्स्ट वाले ग्राफ़ में यही बफ़र सबसे ज्यादा मेमोरी लेते थे। इस बदलाव से गणना की रफ्तार पर असर नहीं पड़ता। साथ ही, CUDA, Metal और Vulkan बैक-एंड पर नए lightning इंडेक्सर का समर्थन भी जोड़ा गया है।

यह क्यों मायने रखता है

लंबे कॉन्टेक्स्ट वाले बड़े भाषा मॉडल चलाने वाले डेवलपर उसी हार्डवेयर पर बड़े प्रॉम्प्ट इस्तेमाल कर सकेंगे।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।