Oossa

llama.cpp يضيف خيارًا لتسريع الانتباه على Hexagon

يرفع العلم الجديد GGML_HEXAGON_FA_HEAD_SPLIT سرعة الانتباه متعدد الأنوية بنسبة تصل إلى 58% في الطُرز المدعومة.

خبر موجزOossaنشرته Oossa: 1 دقائق قراءة

أصدر مشروع llama.cpp الإصدار b11430 في 2026‑10‑05. ويضيف الإصدار خيارًا يُسمى GGML_HEXAGON_FA_HEAD_SPLIT، يتيح لكل نواة معالجة مجموعة فرعية من رؤوس الانتباه عندما يكون عدد رؤوس KV قابلًا للقسمة بالتساوي على عدد الأنوية. ويقلل ذلك كمية ذاكرة التخزين المؤقت لـKV التي يتعين على كل نواة قراءتها، ما يحسّن الاستفادة من نطاق عرض النطاق الترددي للذاكرة. وفي اختبارات على أربع أنوية، ارتفعت السرعة بنسبة 58% مع Qwen3‑0.6B وبنسبة 49% مع llama‑3.2‑3B. هذا التغيير اختياري، ويمكن التحكم فيه عبر الخيار الجديد –fa-head-split في run.py.

لماذا يهم

يمكن للمطورين الذين يشغّلون llama.cpp على أجهزة Qualcomm Hexagon تسريع الاستدلال بوضوح في الطُرز المدعومة، من دون تغيير شيفراتهم.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.