llama.cpp प्रोजेक्ट ने 2026‑10‑05 को संस्करण b11430 जारी किया। इसमें GGML_HEXAGON_FA_HEAD_SPLIT नाम का फ़्लैग जोड़ा गया है। जब KV हेड्स की संख्या कोर की संख्या से पूरी तरह विभाजित होती है, तो यह हर कोर को attention heads के केवल एक हिस्से को संभालने देता है। इससे हर कोर को कम KV cache पढ़ना पड़ता है और मेमोरी बैंडविड्थ का इस्तेमाल बेहतर होता है। चार कोर पर किए गए परीक्षणों में Qwen3‑0.6B की रफ़्तार 58% और llama‑3.2‑3B की 49% बढ़ी। यह बदलाव वैकल्पिक है और run.py में नए –fa-head-split विकल्प से नियंत्रित होता है।
यह क्यों मायने रखता है
Qualcomm Hexagon हार्डवेयर पर llama.cpp चलाने वाले डेवलपर, समर्थित मॉडल पर अपना कोड बदले बिना अनुमान प्रक्रिया को काफ़ी तेज़ कर सकते हैं।