Oossa

llama.cpp, MoE 전문가용 GPU 캐시 추가

오픈소스 라이브러리 llama.cpp가 호스트 메모리에 보관하는 GPU 캐시에 MoE 데이터를 저장하는 기능을 추가했습니다.

짧은 소식작성: Oossa 게시일: 최종 업데이트: 1 분 읽기

ggml‑org 팀은 2026‑10‑08에 llama.cpp 버전 b11480을 출시했습니다. 이번 업데이트에는 호스트 메모리에 두는 MoE 전문가용 GPU 캐시가 추가돼 대형 모델을 GPU에서 더 빠르게 실행할 수 있습니다. 이 변경 사항은 Claude의 지원을 받았다고 표시돼 있으며, 새로운 llama_moe_cache_ptr API를 사용합니다. macOS, iOS 및 여러 Ubuntu 구성용 사전 빌드 바이너리를 다운로드할 수 있습니다.

왜 중요한가

개발자는 이제 일반 소비자용 GPU에서 MoE 모델을 더 효율적으로 실행할 수 있어 AI 프로젝트의 하드웨어 비용을 낮출 수 있습니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.