llama.cpp प्रोजेक्ट ने 2026‑10‑08 को संस्करण b11490 जारी किया। इसमें Hexagon के "alloc_buffer_n" API का सपोर्ट जोड़ा गया है, जिससे बड़े टेंसर कई बफ़रों में बाँटे जा सकते हैं। बड़े मॉडल चलाते समय परफ़ॉर्मेंस में गिरावट से बचने के लिए डिफ़ॉल्ट डायनेमिक बफ़र का आकार 128 MB से बढ़ाकर 512 MB कर दिया गया है। नया "--no-embd-offload" फ़्लैग उन डिवाइसों के लिए कमांड लाइन को सरल बनाता है जो एम्बेडिंग्स को ऑफ़लोड नहीं कर सकते। इन बदलावों के सह-लेखक Jhen‑Jie Hong हैं।
यह क्यों मायने रखता है
Hexagon-आधारित हार्डवेयर इस्तेमाल करने वाले डेवलपर बफ़र को मैन्युअल रूप से सेट किए बिना बड़े भाषा मॉडल अधिक कुशलता से चला सकते हैं।