# llama.cpp b11494, CUDA 워프 최적화 추가

> 오픈소스 Llama.cpp 라이브러리가 CUDA 워프당 GDN 상태 열을 4개 사용해 GPU 성능을 높입니다.

Oossa · 2026-10-08 · https://oossa.com/ko/llama-cpp-release-b11494-adds-cuda-warp-optimizations

ggml‑org 팀이 llama.cpp 버전 b11494를 공개했습니다. 이번 업데이트에서는 CUDA 백엔드가 워프당 GDN 상태 열을 2개 대신 4개 할당하도록 변경했습니다. 이제 이 설정이 기본값입니다. macOS(Apple Silicon 및 Intel), iOS, 여러 Ubuntu 빌드용 바이너리를 다운로드할 수 있습니다.

## 팩트

- 릴리스 태그 b11494가 2026-10-08에 공개됨
- CUDA의 기본 cols_per_warp 값이 4로 설정됨

## 왜 중요한가

NVIDIA GPU에서 llama.cpp를 사용하는 개발자는 코드를 변경하지 않고도 추론 속도 향상을 기대할 수 있습니다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

최종 업데이트: 2026-10-08
