ggml‑org/llama.cpp प्रोजेक्ट ने 3 अक्टूबर 2026 को b11372 संस्करण जारी किया। इस अपडेट में Qwen4exp इंडेक्सर को फिर से लिखा गया है, ताकि हर हेड अलग-अलग अपना स्कोर निकाले और नतीजे सीधे उसी जगह लिखे जाएँ। इससे इंडेक्सर के स्कोर बफ़र के लिए जरूरी मेमोरी आधी रह जाती है। लंबे कॉन्टेक्स्ट वाले ग्राफ़ में यही बफ़र सबसे ज्यादा मेमोरी लेते थे। इस बदलाव से गणना की रफ्तार पर असर नहीं पड़ता। साथ ही, CUDA, Metal और Vulkan बैक-एंड पर नए lightning इंडेक्सर का समर्थन भी जोड़ा गया है।
यह क्यों मायने रखता है
लंबे कॉन्टेक्स्ट वाले बड़े भाषा मॉडल चलाने वाले डेवलपर उसी हार्डवेयर पर बड़े प्रॉम्प्ट इस्तेमाल कर सकेंगे।