# llama.cpp 업데이트, MoE 행렬 곱 효율 개선

> 2026년 9월 30일 출시 버전에서 Vulkan 타일 선택 방식을 조정해 Mixture-of-Experts 모델의 불필요한 연산을 줄였다.

Oossa · 2026-09-29 · https://oossa.com/ko/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

오픈소스 llama.cpp 라이브러리에 MoE를 고려한 행렬 곱셈 관련 Vulkan 수정 사항이 추가됐다. 이번 변경으로 mat_mul_id 연산의 타일 크기를 선택하는 방식을 조정해 전문가별 실제 활성 행 수에 맞췄다. 300억 개 매개변수 모델을 대상으로 한 테스트에서는 실행 시간의 55%를 차지하던 GPU 유휴 작업이 줄었다.

## 팩트

- 릴리스 버전 b11265는 2026년 9월 30일 공개됐다.
- Sarvam 30B 테스트에서 성능 낭비가 55%에서 거의 0으로 줄었다.

## 왜 중요한가

GPU 유휴 시간을 줄이면 Vulkan 호환 하드웨어에서 대형 MoE 모델의 추론 속도를 높일 수 있다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

최종 업데이트: 2026-09-29
