Oossa

llama.cpp, Hexagon 플래시 어텐션 가속하는 헤드 분할 옵션 추가

새 GGML_HEXAGON_FA_HEAD_SPLIT 플래그로 지원 모델의 멀티코어 플래시 어텐션 속도를 최대 58% 높일 수 있습니다.

짧은 소식OossaOossa 게시일: 1 분 읽기

llama.cpp 프로젝트가 2026‑10‑05에 버전 b11430을 출시했습니다. 이번 버전에는 GGML_HEXAGON_FA_HEAD_SPLIT이라는 플래그가 추가됐습니다. KV 헤드 수가 코어 수로 나누어떨어지면 각 코어가 어텐션 헤드 일부만 처리하도록 하는 기능입니다. 이에 따라 각 코어가 읽어야 하는 KV 캐시 양이 줄어 메모리 대역폭을 더 효율적으로 활용할 수 있습니다. 4개 코어를 사용한 테스트에서 Qwen3‑0.6B는 속도가 58%, llama‑3.2‑3B는 49% 향상됐습니다. 이 기능은 선택 사항이며, run.py의 새 –fa-head-split 옵션으로 제어합니다.

왜 중요한가

Qualcomm Hexagon 하드웨어에서 llama.cpp를 실행하는 개발자는 코드 변경 없이도 지원 모델의 추론 속도를 크게 높일 수 있습니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.