# llama.cpp, Hexagon’da flash attention’ı hızlandıran seçeneği ekledi

> Yeni GGML_HEXAGON_FA_HEAD_SPLIT bayrağı, desteklenen modellerde çok çekirdekli flash attention’ı %58’e kadar hızlandırıyor.

Oossa · 2026-10-05 · https://oossa.com/tr/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

llama.cpp projesi, 2026‑10‑05’te b11430 sürümünü yayımladı. Bu sürüm, KV başlıklarının sayısı çekirdek sayısına kalansız bölündüğünde her çekirdeğin attention başlıklarının yalnızca bir alt kümesini işlemesini sağlayan GGML_HEXAGON_FA_HEAD_SPLIT adlı bir bayrak ekliyor. Böylece her çekirdeğin okuması gereken KV önbelleği miktarı azalıyor ve bellek bant genişliği daha verimli kullanılıyor. Dört çekirdekte yapılan testlerde Qwen3‑0.6B’de hız %58, llama‑3.2‑3B’de ise %49 arttı. Bu özellik isteğe bağlı; run.py’deki yeni –fa-head-split seçeneğiyle etkinleştiriliyor.

## Gerçekler

- Yayın tarihi: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- Hız artışı: Qwen3‑0.6B 6977 → 11026 token/s (+%58)

## Neden önemli

llama.cpp’yi Qualcomm Hexagon donanımında çalıştıran geliştiriciler, kodlarında değişiklik yapmadan desteklenen modellerde gözle görülür ölçüde daha hızlı çıkarım elde edebilir.

## Kaynaklar ve referanslar

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Son güncelleme: 2026-10-05
