llama.cpp 프로젝트가 2026년 10월 9일 새 프리릴리스 b11517을 공개했다. 이번 업데이트에는 사용자가 GPU 코드의 저수준 구성 요소인 MMQ 헬퍼에 source-1 정밀도를 전달할 수 있는 CUDA 옵션이 추가됐다. 이 변경은 NVIDIA 기여자가 서명했으며, Linux와 Windows용으로 제공되는 CUDA 12 및 13 빌드에 적용된다. 릴리스에는 macOS Apple Silicon부터 Android Snapdragon까지 여러 플랫폼을 위한 빌드 타깃도 포함됐다.
이번 업데이트는 프로젝트의 GitHub 페이지와 llama.app 웹사이트에서 받을 수 있다.
왜 중요한가
개발자는 이제 llama.cpp에서 GPU 정밀도를 제어할 수 있으며, 이를 통해 LLaMA 모델 실행 시 성능이나 메모리 사용량이 개선될 수 있다.