ggml‑org 팀은 2026년 10월 8일 llama.cpp b11496을 공개했다. 이번 업데이트는 고정 링 버퍼를 통해 대량 모델 업로드를 처리하는 SYCL 단계를 추가해, 호환 GPU에서 로딩 속도를 높인다. macOS(Apple Silicon 및 Intel), iOS, 여러 Ubuntu 빌드(CPU, Vulkan, CUDA 12)용 바이너리를 다운로드할 수 있다.
왜 중요한가
개발자는 SYCL 호환 하드웨어에서 대규모 언어 모델을 더 빠르게 로딩해 llama.cpp를 사용하는 앱의 시작 시간을 줄일 수 있다.