# llama.cpp v b11499, CUDA roll 연산 개선 및 새 바이너리 추가

> 오픈소스 LLM 런타임 llama.cpp가 2026년 10월 8일 b11499 버전을 공개했다. 비연속 roll 연산을 위한 CUDA 수정 사항과 macOS, iOS, Linux용 새 사전 빌드 바이너리가 포함됐다.

Oossa · 2026-10-08 · https://oossa.com/ko/llama-cpp-v-b11499-adds-cuda-roll-improvement-and-new-binaries

ggml-org 팀이 2026년 10월 8일 llama.cpp b11499 버전을 공개했다. 이번 업데이트에서는 CUDA 백엔드가 roll 연산에 바이트 단위 스트라이드를 사용하도록 변경해 GPU가 비연속 데이터를 올바르게 처리할 수 있게 했다. Apple Silicon 및 Intel Mac용 바이너리와 iOS용 바이너리, 여러 Ubuntu 빌드(CPU, Vulkan, CUDA 12)도 새로 제공된다. 모든 파일은 GitHub 릴리스 페이지에서 내려받을 수 있다.

## 팩트

- b11499 버전은 2026년 10월 8일 공개됐다
- CUDA 백엔드에서 바이트 스트라이드 방식의 roll 연산을 지원한다

## 왜 중요한가

개발자는 더 다양한 GPU 환경에서 오류 없이 llama.cpp를 실행할 수 있어 데스크톱과 서버에서 로컬 LLM을 활용할 범위가 넓어진다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11499](https://github.com/ggml-org/llama.cpp/releases/tag/b11499) – llama.cpp, 2026-10-08

최종 업데이트: 2026-10-08
