# llama.cpp, Hexagon 플래시 어텐션 가속하는 헤드 분할 옵션 추가

> 새 GGML_HEXAGON_FA_HEAD_SPLIT 플래그로 지원 모델의 멀티코어 플래시 어텐션 속도를 최대 58% 높일 수 있습니다.

Oossa · 2026-10-05 · https://oossa.com/ko/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

llama.cpp 프로젝트가 2026‑10‑05에 버전 b11430을 출시했습니다. 이번 버전에는 GGML_HEXAGON_FA_HEAD_SPLIT이라는 플래그가 추가됐습니다. KV 헤드 수가 코어 수로 나누어떨어지면 각 코어가 어텐션 헤드 일부만 처리하도록 하는 기능입니다. 이에 따라 각 코어가 읽어야 하는 KV 캐시 양이 줄어 메모리 대역폭을 더 효율적으로 활용할 수 있습니다. 4개 코어를 사용한 테스트에서 Qwen3‑0.6B는 속도가 58%, llama‑3.2‑3B는 49% 향상됐습니다. 이 기능은 선택 사항이며, run.py의 새 –fa-head-split 옵션으로 제어합니다.

## 팩트

- 출시일: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- 속도 향상: Qwen3‑0.6B 6977 → 11026 tokens/s (+58%)

## 왜 중요한가

Qualcomm Hexagon 하드웨어에서 llama.cpp를 실행하는 개발자는 코드 변경 없이도 지원 모델의 추론 속도를 크게 높일 수 있습니다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

최종 업데이트: 2026-10-05
