ggml-org 팀이 2026-10-09 llama.cpp 릴리스 b11515를 공개했다. 이번 업데이트에는 SYCL 기반 Q5_K 재정렬 레이아웃 행렬-벡터 양자화(MMVQ)와 융합 GLU 연산자가 추가돼 호환 하드웨어에서 성능을 높인다. 릴리스에는 Apple Silicon, Intel Mac, iOS, Ubuntu(CPU, Vulkan, CUDA 12.8), IBM s390x용으로 바로 실행할 수 있는 바이너리도 포함됐다. 사용자는 GitHub 페이지에서 기기에 맞는 압축 파일을 내려받을 수 있다.
왜 중요한가
개발자는 이제 소스 코드에서 직접 빌드하지 않고도 SYCL 호환 GPU에서 llama.cpp를 더 빠르게 실행할 수 있다.