ggml‑org 팀은 2026년 10월 8일 llama.cpp 버전 b11507을 공개했습니다. 이번 업데이트에서는 여러 GPU에 분산할 수 있는 전문가 혼합(MoE) 캐시를 지원합니다. 덕분에 개발자는 모든 데이터를 GPU 한 장에 담지 않고도 더 큰 MoE 모델을 실행할 수 있습니다. 이번 릴리스에는 macOS와 iOS, CUDA 12.8 지원을 포함한 여러 Linux 구성용 새 바이너리 패키지도 포함됐습니다.
왜 중요한가
개발자는 이제 여러 GPU를 갖춘 시스템에서 더 크고 성능이 뛰어난 AI 모델을 실행할 수 있어, 개인용 하드웨어로 할 수 있는 일이 늘어납니다.