ggml‑org 팀이 llama.cpp 버전 b11324를 출시했다. 이번 업데이트에는 모델을 불러올 때 각 텐서의 전체 크기만큼 복사본을 하나 더 만들지 않도록 하는 메모리 매핑 모드가 추가됐다. 이 기능은 macOS(Apple Silicon 및 Intel), iOS와 여러 Ubuntu 빌드용 새 바이너리 패키지에서 사용할 수 있다. 이번 릴리스에는 Claude와 NVIDIA 엔지니어 Pranesh Gonegandla의 기여도 포함됐다.
왜 중요한가
개발자는 같은 하드웨어에서 더 큰 언어 모델을 실행할 수 있어, 메모리가 제한적인 취미 개발자와 소규모 팀에 도움이 된다.