ggml-org 팀은 2026년 10월 10일 llama.cpp 버전 b11540을 공개했다. 이번 업데이트에서는 산술 디코딩과 가중치 재정렬을 활용해 MXFP4 전문가 혼합(MoE) 모델의 처리 속도를 높이는 SYCL 지원이 추가됐다. macOS Apple Silicon 및 Intel, iOS와 여러 Ubuntu 버전용 사전 빌드 바이너리도 제공한다(CPU, Vulkan, CUDA). 변경 사항은 GitHub의 b11540 태그에 정리돼 있다.
왜 중요한가
이제 개발자는 SYCL을 지원하는 GPU에서 더 큰 MoE 모델을 빠르게 실행할 수 있어 llama.cpp 사용자가 선택할 수 있는 하드웨어가 늘어난다.