# llama.cpp अपडेट से इंडेक्सर की मेमोरी आधी हुई

> b11372 रिलीज़ में Qwen4exp इंडेक्सर को इस तरह बदला गया है कि लंबा कॉन्टेक्स्ट चलाने पर काफी कम RAM लगेगी और रफ्तार भी कम नहीं होगी।

Oossa · 2026-10-03 · https://oossa.com/hi/llama-cpp-update-cuts-indexer-memory-use-in-half

ggml‑org/llama.cpp प्रोजेक्ट ने 3 अक्टूबर 2026 को b11372 संस्करण जारी किया। इस अपडेट में Qwen4exp इंडेक्सर को फिर से लिखा गया है, ताकि हर हेड अलग-अलग अपना स्कोर निकाले और नतीजे सीधे उसी जगह लिखे जाएँ। इससे इंडेक्सर के स्कोर बफ़र के लिए जरूरी मेमोरी आधी रह जाती है। लंबे कॉन्टेक्स्ट वाले ग्राफ़ में यही बफ़र सबसे ज्यादा मेमोरी लेते थे। इस बदलाव से गणना की रफ्तार पर असर नहीं पड़ता। साथ ही, CUDA, Metal और Vulkan बैक-एंड पर नए lightning इंडेक्सर का समर्थन भी जोड़ा गया है।

## तथ्य

- रिलीज़ टैग b11372 शनिवार, 3 अक्टूबर 2026 को प्रकाशित हुआ
- इंडेक्सर के स्कोर के लिए इस्तेमाल होने वाली मेमोरी करीब 50% कम हुई

## यह क्यों मायने रखता है

लंबे कॉन्टेक्स्ट वाले बड़े भाषा मॉडल चलाने वाले डेवलपर उसी हार्डवेयर पर बड़े प्रॉम्प्ट इस्तेमाल कर सकेंगे।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

अंतिम अपडेट: 2026-10-03
