ggml-org 팀은 2026년 10월 8일 llama.cpp 버전 b11510을 공개했다. 이번 버전에는 65,000개가 넘는 행이나 슬라이스가 있는 텐서를 처리할 수 있도록 루프 방식의 PAD 커널이 CUDA용으로 추가됐다. Apple Silicon, Intel macOS, iOS와 여러 Ubuntu 빌드(CPU, Vulkan, CUDA 12.8)용 사전 빌드 바이너리도 함께 제공한다. 코드와 인증 자료는 GitHub 페이지에서 확인할 수 있다.
왜 중요한가
개발자는 이제 이전의 행 제한에 걸리지 않고 NVIDIA GPU에서 더 큰 언어 모델을 실행할 수 있다.