Oossa

llama.cpp, Hexagon’da flash attention’ı hızlandıran seçeneği ekledi

Yeni GGML_HEXAGON_FA_HEAD_SPLIT bayrağı, desteklenen modellerde çok çekirdekli flash attention’ı %58’e kadar hızlandırıyor.

Kısa haberOossaOossa yayın tarihi: 1 dk okuma

llama.cpp projesi, 2026‑10‑05’te b11430 sürümünü yayımladı. Bu sürüm, KV başlıklarının sayısı çekirdek sayısına kalansız bölündüğünde her çekirdeğin attention başlıklarının yalnızca bir alt kümesini işlemesini sağlayan GGML_HEXAGON_FA_HEAD_SPLIT adlı bir bayrak ekliyor. Böylece her çekirdeğin okuması gereken KV önbelleği miktarı azalıyor ve bellek bant genişliği daha verimli kullanılıyor. Dört çekirdekte yapılan testlerde Qwen3‑0.6B’de hız %58, llama‑3.2‑3B’de ise %49 arttı. Bu özellik isteğe bağlı; run.py’deki yeni –fa-head-split seçeneğiyle etkinleştiriliyor.

Neden önemli

llama.cpp’yi Qualcomm Hexagon donanımında çalıştıran geliştiriciler, kodlarında değişiklik yapmadan desteklenen modellerde gözle görülür ölçüde daha hızlı çıkarım elde edebilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.