ggml-org 팀은 2026년 9월 30일 llama.cpp 버전 b11270을 공개했다. 이번 버전은 AMD의 HIP 플랫폼에서 사용하는 GPU 연산을 조정해, 느린 바이트 뺄셈 명령어를 더 빠른 명령어로 대체했다. 또한 Apple Silicon 및 Intel용 macOS, iOS, Vulkan을 지원하는 GPU 버전을 포함한 여러 Ubuntu 빌드용 새 바이너리 패키지를 제공한다.
왜 중요한가
이번 GPU 최적화는 AMD 하드웨어에서 추론 속도를 높일 수 있으며, 바로 실행할 수 있는 바이너리를 제공해 개발자가 더 다양한 플랫폼에서 llama.cpp를 쉽게 사용해 볼 수 있다.