오픈소스 llama.cpp 라이브러리에 MoE를 고려한 행렬 곱셈 관련 Vulkan 수정 사항이 추가됐다. 이번 변경으로 mat_mul_id 연산의 타일 크기를 선택하는 방식을 조정해 전문가별 실제 활성 행 수에 맞췄다. 300억 개 매개변수 모델을 대상으로 한 테스트에서는 실행 시간의 55%를 차지하던 GPU 유휴 작업이 줄었다.
왜 중요한가
GPU 유휴 시간을 줄이면 Vulkan 호환 하드웨어에서 대형 MoE 모델의 추론 속도를 높일 수 있다.