# llama.cpp يضيف خيارًا لتسريع الانتباه على Hexagon

> يرفع العلم الجديد GGML_HEXAGON_FA_HEAD_SPLIT سرعة الانتباه متعدد الأنوية بنسبة تصل إلى 58% في الطُرز المدعومة.

Oossa · 2026-10-05 · https://oossa.com/ar/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

أصدر مشروع llama.cpp الإصدار b11430 في 2026‑10‑05. ويضيف الإصدار خيارًا يُسمى GGML_HEXAGON_FA_HEAD_SPLIT، يتيح لكل نواة معالجة مجموعة فرعية من رؤوس الانتباه عندما يكون عدد رؤوس KV قابلًا للقسمة بالتساوي على عدد الأنوية. ويقلل ذلك كمية ذاكرة التخزين المؤقت لـKV التي يتعين على كل نواة قراءتها، ما يحسّن الاستفادة من نطاق عرض النطاق الترددي للذاكرة. وفي اختبارات على أربع أنوية، ارتفعت السرعة بنسبة 58% مع Qwen3‑0.6B وبنسبة 49% مع llama‑3.2‑3B. هذا التغيير اختياري، ويمكن التحكم فيه عبر الخيار الجديد –fa-head-split في run.py.

## الحقائق

- تاريخ الإصدار: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- زيادة السرعة: Qwen3‑0.6B من 6977 إلى 11026 رمزًا/ثانية (+58%)

## لماذا يهم

يمكن للمطورين الذين يشغّلون llama.cpp على أجهزة Qualcomm Hexagon تسريع الاستدلال بوضوح في الطُرز المدعومة، من دون تغيير شيفراتهم.

## المصادر والمراجع

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

آخر تحديث: 2026-10-05
