Oossa

llama.cpp, 여러 GPU에 걸친 MoE 캐시 지원

오픈소스 Llama.cpp 라이브러리로 이제 여러 GPU에서 전문가 혼합(MoE) 모델을 실행할 수 있습니다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

ggml‑org 팀은 2026년 10월 8일 llama.cpp 버전 b11507을 공개했습니다. 이번 업데이트에서는 여러 GPU에 분산할 수 있는 전문가 혼합(MoE) 캐시를 지원합니다. 덕분에 개발자는 모든 데이터를 GPU 한 장에 담지 않고도 더 큰 MoE 모델을 실행할 수 있습니다. 이번 릴리스에는 macOS와 iOS, CUDA 12.8 지원을 포함한 여러 Linux 구성용 새 바이너리 패키지도 포함됐습니다.

왜 중요한가

개발자는 이제 여러 GPU를 갖춘 시스템에서 더 크고 성능이 뛰어난 AI 모델을 실행할 수 있어, 개인용 하드웨어로 할 수 있는 일이 늘어납니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.