ggml‑org/llama.cpp 프로젝트가 2026년 9월 30일 사전 릴리스 빌드(tag b11272)를 공개했다. 이번 빌드에는 언어 모델 추론에서 자주 사용되는 연결(concat) 연산을 Hexagon에 맞게 최적화한 기능이 추가됐다. 이 변경으로 패킷 오버헤드를 줄이고 더 빠른 나눗셈 루틴을 사용해 데이터를 옮기는 핫 루프의 속도를 높였다. 이번 업데이트는 Android Snapdragon 기기의 Hexagon NPU를 비롯해 다양한 플랫폼용 빌드가 포함된 더 큰 릴리스 작업의 일부다.
왜 중요한가
Snapdragon 휴대전화에서 LLM을 실행할 때 체감 속도가 빨라져 기기 내 AI 작업의 지연 시간이 줄어든다.