llama.cpp 프로젝트가 2026‑10‑05에 버전 b11430을 출시했습니다. 이번 버전에는 GGML_HEXAGON_FA_HEAD_SPLIT이라는 플래그가 추가됐습니다. KV 헤드 수가 코어 수로 나누어떨어지면 각 코어가 어텐션 헤드 일부만 처리하도록 하는 기능입니다. 이에 따라 각 코어가 읽어야 하는 KV 캐시 양이 줄어 메모리 대역폭을 더 효율적으로 활용할 수 있습니다. 4개 코어를 사용한 테스트에서 Qwen3‑0.6B는 속도가 58%, llama‑3.2‑3B는 49% 향상됐습니다. 이 기능은 선택 사항이며, run.py의 새 –fa-head-split 옵션으로 제어합니다.
왜 중요한가
Qualcomm Hexagon 하드웨어에서 llama.cpp를 실행하는 개발자는 코드 변경 없이도 지원 모델의 추론 속도를 크게 높일 수 있습니다.