OossaAI는 빠르게 발전하고 있습니다. 저희가 쉽게 설명해 드립니다.

llama.cpp 업데이트, MoE 행렬 곱 효율 개선

2026년 9월 30일 출시 버전에서 Vulkan 타일 선택 방식을 조정해 Mixture-of-Experts 모델의 불필요한 연산을 줄였다.

짧은 소식Oossa1 분 읽기

오픈소스 llama.cpp 라이브러리에 MoE를 고려한 행렬 곱셈 관련 Vulkan 수정 사항이 추가됐다. 이번 변경으로 mat_mul_id 연산의 타일 크기를 선택하는 방식을 조정해 전문가별 실제 활성 행 수에 맞췄다. 300억 개 매개변수 모델을 대상으로 한 테스트에서는 실행 시간의 55%를 차지하던 GPU 유휴 작업이 줄었다.

왜 중요한가

GPU 유휴 시간을 줄이면 Vulkan 호환 하드웨어에서 대형 MoE 모델의 추론 속도를 높일 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.

출처 및 참고 자료

#출처매체날짜핵심 내용
1ggml-org/llama.cpp b11265 ↗llama.cpp2026. 9. 29.<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 개 출처

최종 업데이트: ·Markdown·llms.txt