Oossa

llama.cpp में Hexagon पर तेज़ flash-attention के लिए head-split विकल्प

नया GGML_HEXAGON_FA_HEAD_SPLIT फ़्लैग समर्थित मॉडल पर मल्टी-कोर flash-attention को 58% तक तेज़ करता है।

संक्षिप्तOossaOossa द्वारा प्रकाशित: 1 मिनट पढ़ना

llama.cpp प्रोजेक्ट ने 2026‑10‑05 को संस्करण b11430 जारी किया। इसमें GGML_HEXAGON_FA_HEAD_SPLIT नाम का फ़्लैग जोड़ा गया है। जब KV हेड्स की संख्या कोर की संख्या से पूरी तरह विभाजित होती है, तो यह हर कोर को attention heads के केवल एक हिस्से को संभालने देता है। इससे हर कोर को कम KV cache पढ़ना पड़ता है और मेमोरी बैंडविड्थ का इस्तेमाल बेहतर होता है। चार कोर पर किए गए परीक्षणों में Qwen3‑0.6B की रफ़्तार 58% और llama‑3.2‑3B की 49% बढ़ी। यह बदलाव वैकल्पिक है और run.py में नए –fa-head-split विकल्प से नियंत्रित होता है।

यह क्यों मायने रखता है

Qualcomm Hexagon हार्डवेयर पर llama.cpp चलाने वाले डेवलपर, समर्थित मॉडल पर अपना कोड बदले बिना अनुमान प्रक्रिया को काफ़ी तेज़ कर सकते हैं।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।