ggml-org 팀이 2026년 10월 8일 llama.cpp b11499 버전을 공개했다. 이번 업데이트에서는 CUDA 백엔드가 roll 연산에 바이트 단위 스트라이드를 사용하도록 변경해 GPU가 비연속 데이터를 올바르게 처리할 수 있게 했다. Apple Silicon 및 Intel Mac용 바이너리와 iOS용 바이너리, 여러 Ubuntu 빌드(CPU, Vulkan, CUDA 12)도 새로 제공된다. 모든 파일은 GitHub 릴리스 페이지에서 내려받을 수 있다.
왜 중요한가
개발자는 더 다양한 GPU 환경에서 오류 없이 llama.cpp를 실행할 수 있어 데스크톱과 서버에서 로컬 LLM을 활용할 범위가 넓어진다.