# llama.cpp, 텐서 복사 줄이는 메모리 매핑 옵션 추가

> 오픈소스 LLM 런타임에 모델 데이터를 직접 매핑하는 기능이 추가돼 macOS, iOS, Linux 빌드에서 RAM 사용량을 줄일 수 있다.

Oossa · 2026-10-01 · https://oossa.com/ko/llama-cpp-release-adds-memory-map-option-to-cut-tensor-copies

ggml‑org 팀이 llama.cpp 버전 b11324를 출시했다. 이번 업데이트에는 모델을 불러올 때 각 텐서의 전체 크기만큼 복사본을 하나 더 만들지 않도록 하는 메모리 매핑 모드가 추가됐다. 이 기능은 macOS(Apple Silicon 및 Intel), iOS와 여러 Ubuntu 빌드용 새 바이너리 패키지에서 사용할 수 있다. 이번 릴리스에는 Claude와 NVIDIA 엔지니어 Pranesh Gonegandla의 기여도 포함됐다.

## 팩트

- 버전 b11324가 2026-10-01에 출시됐다
- RAM 사용량을 줄이는 llama‑mmap 기능이 추가됐다

## 왜 중요한가

개발자는 같은 하드웨어에서 더 큰 언어 모델을 실행할 수 있어, 메모리가 제한적인 취미 개발자와 소규모 팀에 도움이 된다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11324](https://github.com/ggml-org/llama.cpp/releases/tag/b11324) – llama.cpp, 2026-10-01

최종 업데이트: 2026-10-01
