# llama.cpp, MoE 전문가용 GPU 캐시 추가

> 오픈소스 라이브러리 llama.cpp가 호스트 메모리에 보관하는 GPU 캐시에 MoE 데이터를 저장하는 기능을 추가했습니다.

Oossa · 2026-10-08 · https://oossa.com/ko/llama-cpp-adds-gpu-cache-for-moe-experts

ggml‑org 팀은 2026‑10‑08에 llama.cpp 버전 b11480을 출시했습니다. 이번 업데이트에는 호스트 메모리에 두는 MoE 전문가용 GPU 캐시가 추가돼 대형 모델을 GPU에서 더 빠르게 실행할 수 있습니다. 이 변경 사항은 Claude의 지원을 받았다고 표시돼 있으며, 새로운 llama_moe_cache_ptr API를 사용합니다. macOS, iOS 및 여러 Ubuntu 구성용 사전 빌드 바이너리를 다운로드할 수 있습니다.

## 팩트

- 출시 버전: b11480
- 출시일: 2026‑10‑08

## 왜 중요한가

개발자는 이제 일반 소비자용 GPU에서 MoE 모델을 더 효율적으로 실행할 수 있어 AI 프로젝트의 하드웨어 비용을 낮출 수 있습니다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

최종 업데이트: 2026-10-08
