В библиотеке с открытым исходным кодом llama.cpp исправили умножение матриц с учётом MoE для Vulkan. Изменение корректирует выбор размеров тайлов для операции mat_mul_id, чтобы он соответствовал фактическому числу активных строк у каждого эксперта. В тесте на модели с 30 млрд параметров исправление сократило бесполезную нагрузку на GPU, на которую раньше приходилось 55% времени работы.
Почему это важно
Меньше простоя GPU — быстрее инференс крупных MoE-моделей на оборудовании, совместимом с Vulkan.