# llama.cpp, 여러 GPU에 걸친 MoE 캐시 지원

> 오픈소스 Llama.cpp 라이브러리로 이제 여러 GPU에서 전문가 혼합(MoE) 모델을 실행할 수 있습니다.

Oossa · 2026-10-08 · https://oossa.com/ko/llama-cpp-adds-multi-gpu-moe-cache-support

ggml‑org 팀은 2026년 10월 8일 llama.cpp 버전 b11507을 공개했습니다. 이번 업데이트에서는 여러 GPU에 분산할 수 있는 전문가 혼합(MoE) 캐시를 지원합니다. 덕분에 개발자는 모든 데이터를 GPU 한 장에 담지 않고도 더 큰 MoE 모델을 실행할 수 있습니다. 이번 릴리스에는 macOS와 iOS, CUDA 12.8 지원을 포함한 여러 Linux 구성용 새 바이너리 패키지도 포함됐습니다.

## 팩트

- 버전 b11507이 2026-10-08에 공개됨
- 여러 GPU에 걸친 MoE 캐시 지원 추가

## 왜 중요한가

개발자는 이제 여러 GPU를 갖춘 시스템에서 더 크고 성능이 뛰어난 AI 모델을 실행할 수 있어, 개인용 하드웨어로 할 수 있는 일이 늘어납니다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

최종 업데이트: 2026-10-08
