# llama.cpp में Hexagon पर तेज़ flash-attention के लिए head-split विकल्प

> नया GGML_HEXAGON_FA_HEAD_SPLIT फ़्लैग समर्थित मॉडल पर मल्टी-कोर flash-attention को 58% तक तेज़ करता है।

Oossa · 2026-10-05 · https://oossa.com/hi/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

llama.cpp प्रोजेक्ट ने 2026‑10‑05 को संस्करण b11430 जारी किया। इसमें GGML_HEXAGON_FA_HEAD_SPLIT नाम का फ़्लैग जोड़ा गया है। जब KV हेड्स की संख्या कोर की संख्या से पूरी तरह विभाजित होती है, तो यह हर कोर को attention heads के केवल एक हिस्से को संभालने देता है। इससे हर कोर को कम KV cache पढ़ना पड़ता है और मेमोरी बैंडविड्थ का इस्तेमाल बेहतर होता है। चार कोर पर किए गए परीक्षणों में Qwen3‑0.6B की रफ़्तार 58% और llama‑3.2‑3B की 49% बढ़ी। यह बदलाव वैकल्पिक है और run.py में नए –fa-head-split विकल्प से नियंत्रित होता है।

## तथ्य

- रिलीज़ की तारीख: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- रफ़्तार में बढ़ोतरी: Qwen3‑0.6B 6977 → 11026 टोकन/सेकंड (+58%)

## यह क्यों मायने रखता है

Qualcomm Hexagon हार्डवेयर पर llama.cpp चलाने वाले डेवलपर, समर्थित मॉडल पर अपना कोड बदले बिना अनुमान प्रक्रिया को काफ़ी तेज़ कर सकते हैं।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

अंतिम अपडेट: 2026-10-05
