llama.cpp 프로젝트가 2026‑10‑08 버전 b11490을 공개했다. 이번 버전은 Hexagon의 "alloc_buffer_n" API를 지원해 대형 텐서를 여러 버퍼로 나눌 수 있다. 대형 모델에서 성능이 떨어지는 현상을 막기 위해 기본 동적 버퍼 크기도 128 MB에서 512 MB로 늘렸다. 임베딩 오프로드를 지원하지 않는 기기에서 명령줄을 간소화하는 새 플래그 "--no-embd-offload"도 추가됐다. 이번 변경에는 Jhen‑Jie Hong도 공동 작성자로 참여했다.
왜 중요한가
Hexagon 기반 하드웨어를 사용하는 개발자는 버퍼 크기를 수동으로 조정하지 않고도 더 큰 언어 모델을 효율적으로 실행할 수 있다.