Oossa

افزایش سرعت فلش‌اتنشن روی Hexagon با تقسیم هدها در llama.cpp

پرچم جدید GGML_HEXAGON_FA_HEAD_SPLIT اجرای فلش‌اتنشن چند‌هسته‌ای را در مدل‌های پشتیبانی‌شده تا ۵۸٪ سریع‌تر می‌کند.

خبر کوتاهOossaمنتشرشده توسط Oossa: 1 دقیقه مطالعه

پروژه llama.cpp نسخهٔ b11430 را در 2026‑10‑05 منتشر کرد. این نسخه پرچمی به نام GGML_HEXAGON_FA_HEAD_SPLIT اضافه می‌کند که وقتی تعداد هدهای KV بر تعداد هسته‌ها بخش‌پذیر باشد، به هر هسته اجازه می‌دهد فقط بخشی از هدهای اتنشن را پردازش کند. در نتیجه، حجم کش KV که هر هسته باید بخواند کمتر می‌شود و استفاده از پهنای باند حافظه بهبود می‌یابد. در آزمایش روی چهار هسته، سرعت Qwen3‑0.6B تا ۵۸٪ و llama‑3.2‑3B تا ۴۹٪ افزایش یافت. این قابلیت اختیاری است و با گزینهٔ جدید –fa-head-split در run.py کنترل می‌شود.

چرا مهم است

توسعه‌دهندگانی که llama.cpp را روی سخت‌افزار Qualcomm Hexagon اجرا می‌کنند، می‌توانند در مدل‌های پشتیبانی‌شده بدون تغییر کدشان به استنتاجی به‌مراتب سریع‌تر دست پیدا کنند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.