# llama.cpp v0.2.0 प्री-रिलीज़ में Hexagon CPU ऑप्टिमाइज़ेशन

> ओपन-सोर्स LLM रनर ने Snapdragon चिप्स पर concat ऑपरेशन तेज़ करने के लिए अपना Hexagon बैकएंड अपडेट किया है।

Oossa · 2026-09-30 · https://oossa.com/hi/llama-cpp-v0-2-0-pre-release-adds-hexagon-cpu-optimizations

ggml‑org/llama.cpp प्रोजेक्ट ने 30 सितंबर 2026 को एक प्री-रिलीज़ बिल्ड (टैग b11272) जारी किया। इसमें concat ऑपरेशन के लिए Hexagon-विशिष्ट ऑप्टिमाइज़ेशन जोड़ा गया है, जो भाषा मॉडल के इन्फ़रेंस में आम तौर पर इस्तेमाल होने वाला चरण है। इस बदलाव से पैकेट का ओवरहेड घटता है और तेज़ division रूटीन का इस्तेमाल होता है, जिससे डेटा इधर-उधर ले जाने वाला हॉट लूप तेज़ चलता है। यह अपडेट कई प्लेटफ़ॉर्म के लिए जारी बिल्ड्स के व्यापक सेट का हिस्सा है, जिनमें Hexagon NPU वाले Android Snapdragon डिवाइस भी शामिल हैं।

## तथ्य

- रिलीज़ टैग: b11272 (कमिट 7fee178), 30 सितंबर 2026 को जारी
- Hexagon concat ऑप्टिमाइज़ेशन पैकेट की संख्या घटाता है और fast-div निर्देश का इस्तेमाल करता है

## यह क्यों मायने रखता है

इससे Snapdragon फोन पर LLM चलाना काफ़ी तेज़ हो जाता है और डिवाइस पर AI कामों की लेटेंसी घटती है।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11272](https://github.com/ggml-org/llama.cpp/releases/tag/b11272) – llama.cpp, 2026-09-30

अंतिम अपडेट: 2026-09-30
