A biblioteca de código aberto llama.cpp recebeu uma correção para a multiplicação de matrizes com suporte a MoE no Vulkan. A mudança ajusta a forma como o código escolhe os tamanhos dos blocos para a operação mat_mul_id, fazendo com que correspondam ao número real de linhas ativas por especialista. Em um teste com um modelo de 30 bilhões de parâmetros, a correção reduziu o trabalho ocioso da GPU, que antes consumia 55% do tempo de execução.
Por que importa
Menos tempo ocioso da GPU significa inferência mais rápida para grandes modelos MoE executados em hardware compatível com Vulkan.