ggml‑org 팀은 2026‑10‑08에 llama.cpp 버전 b11480을 출시했습니다. 이번 업데이트에는 호스트 메모리에 두는 MoE 전문가용 GPU 캐시가 추가돼 대형 모델을 GPU에서 더 빠르게 실행할 수 있습니다. 이 변경 사항은 Claude의 지원을 받았다고 표시돼 있으며, 새로운 llama_moe_cache_ptr API를 사용합니다. macOS, iOS 및 여러 Ubuntu 구성용 사전 빌드 바이너리를 다운로드할 수 있습니다.
왜 중요한가
개발자는 이제 일반 소비자용 GPU에서 MoE 모델을 더 효율적으로 실행할 수 있어 AI 프로젝트의 하드웨어 비용을 낮출 수 있습니다.