Oossa

llama.cpp, 512 초과 블록 너비 지원 CUDA 커널 추가

Oct 8, 2026 릴리스에서 NVIDIA GPU용 고속 FWHT 커널이 추가돼 1,024~8,192 너비를 지원한다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

llama.cpp 프로젝트가 Oct 8, 2026에 버전 b11482를 출시했다. 이번 버전에는 블록 너비 512 초과를 지원하는 CUDA FWHT 커널이 추가돼 FP32와 FP16 데이터 모두에서 1,024~8,192 너비를 처리할 수 있다. 기존 F16 인프라를 재사용했으며 A10 GPU에서 테스트를 통과했다. 기존 워프 너비 커널(64~512)은 변경되지 않았다.

왜 중요한가

GPU 사용자는 이제 llama.cpp에서 더 큰 너비의 행렬 곱셈을 더 빠르게 실행할 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.