پروژه llama.cpp نسخهٔ b11430 را در 2026‑10‑05 منتشر کرد. این نسخه پرچمی به نام GGML_HEXAGON_FA_HEAD_SPLIT اضافه میکند که وقتی تعداد هدهای KV بر تعداد هستهها بخشپذیر باشد، به هر هسته اجازه میدهد فقط بخشی از هدهای اتنشن را پردازش کند. در نتیجه، حجم کش KV که هر هسته باید بخواند کمتر میشود و استفاده از پهنای باند حافظه بهبود مییابد. در آزمایش روی چهار هسته، سرعت Qwen3‑0.6B تا ۵۸٪ و llama‑3.2‑3B تا ۴۹٪ افزایش یافت. این قابلیت اختیاری است و با گزینهٔ جدید –fa-head-split در run.py کنترل میشود.
چرا مهم است
توسعهدهندگانی که llama.cpp را روی سختافزار Qualcomm Hexagon اجرا میکنند، میتوانند در مدلهای پشتیبانیشده بدون تغییر کدشان به استنتاجی بهمراتب سریعتر دست پیدا کنند.