# llama.cpp, 512 초과 블록 너비 지원 CUDA 커널 추가

> Oct 8, 2026 릴리스에서 NVIDIA GPU용 고속 FWHT 커널이 추가돼 1,024~8,192 너비를 지원한다.

Oossa · 2026-10-08 · https://oossa.com/ko/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

llama.cpp 프로젝트가 Oct 8, 2026에 버전 b11482를 출시했다. 이번 버전에는 블록 너비 512 초과를 지원하는 CUDA FWHT 커널이 추가돼 FP32와 FP16 데이터 모두에서 1,024~8,192 너비를 처리할 수 있다. 기존 F16 인프라를 재사용했으며 A10 GPU에서 테스트를 통과했다. 기존 워프 너비 커널(64~512)은 변경되지 않았다.

## 팩트

- 릴리스 태그 b11482, 게시일 Oct 8, 2026
- 새 커널은 FP32 및 FP16에서 1,024~8,192 너비 지원

## 왜 중요한가

GPU 사용자는 이제 llama.cpp에서 더 큰 너비의 행렬 곱셈을 더 빠르게 실행할 수 있다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

최종 업데이트: 2026-10-08
