# افزایش سرعت فلش‌اتنشن روی Hexagon با تقسیم هدها در llama.cpp

> پرچم جدید GGML_HEXAGON_FA_HEAD_SPLIT اجرای فلش‌اتنشن چند‌هسته‌ای را در مدل‌های پشتیبانی‌شده تا ۵۸٪ سریع‌تر می‌کند.

Oossa · 2026-10-05 · https://oossa.com/fa/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

پروژه llama.cpp نسخهٔ b11430 را در 2026‑10‑05 منتشر کرد. این نسخه پرچمی به نام GGML_HEXAGON_FA_HEAD_SPLIT اضافه می‌کند که وقتی تعداد هدهای KV بر تعداد هسته‌ها بخش‌پذیر باشد، به هر هسته اجازه می‌دهد فقط بخشی از هدهای اتنشن را پردازش کند. در نتیجه، حجم کش KV که هر هسته باید بخواند کمتر می‌شود و استفاده از پهنای باند حافظه بهبود می‌یابد. در آزمایش روی چهار هسته، سرعت Qwen3‑0.6B تا ۵۸٪ و llama‑3.2‑3B تا ۴۹٪ افزایش یافت. این قابلیت اختیاری است و با گزینهٔ جدید –fa-head-split در run.py کنترل می‌شود.

## حقایق

- تاریخ انتشار: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- افزایش سرعت: Qwen3‑0.6B از 6977 به 11026 توکن بر ثانیه (+58٪)

## چرا مهم است

توسعه‌دهندگانی که llama.cpp را روی سخت‌افزار Qualcomm Hexagon اجرا می‌کنند، می‌توانند در مدل‌های پشتیبانی‌شده بدون تغییر کدشان به استنتاجی به‌مراتب سریع‌تر دست پیدا کنند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

آخرین به‌روزرسانی: 2026-10-05
