llama.cpp 프로젝트가 Oct 8, 2026에 버전 b11482를 출시했다. 이번 버전에는 블록 너비 512 초과를 지원하는 CUDA FWHT 커널이 추가돼 FP32와 FP16 데이터 모두에서 1,024~8,192 너비를 처리할 수 있다. 기존 F16 인프라를 재사용했으며 A10 GPU에서 테스트를 통과했다. 기존 워프 너비 커널(64~512)은 변경되지 않았다.
왜 중요한가
GPU 사용자는 이제 llama.cpp에서 더 큰 너비의 행렬 곱셈을 더 빠르게 실행할 수 있다.