ggml‑org/llama.cpp प्रोजेक्ट ने 30 सितंबर 2026 को एक प्री-रिलीज़ बिल्ड (टैग b11272) जारी किया। इसमें concat ऑपरेशन के लिए Hexagon-विशिष्ट ऑप्टिमाइज़ेशन जोड़ा गया है, जो भाषा मॉडल के इन्फ़रेंस में आम तौर पर इस्तेमाल होने वाला चरण है। इस बदलाव से पैकेट का ओवरहेड घटता है और तेज़ division रूटीन का इस्तेमाल होता है, जिससे डेटा इधर-उधर ले जाने वाला हॉट लूप तेज़ चलता है। यह अपडेट कई प्लेटफ़ॉर्म के लिए जारी बिल्ड्स के व्यापक सेट का हिस्सा है, जिनमें Hexagon NPU वाले Android Snapdragon डिवाइस भी शामिल हैं।
यह क्यों मायने रखता है
इससे Snapdragon फोन पर LLM चलाना काफ़ी तेज़ हो जाता है और डिवाइस पर AI कामों की लेटेंसी घटती है।