OossaИИ быстро развивается. Объясняем просто.

Обновление llama.cpp ускоряет умножение матриц в MoE

В релизе от 30 сентября 2026 года изменён выбор размеров тайлов в Vulkan, что сокращает лишнюю работу в моделях Mixture-of-Experts.

ЗаметкаOossa1 мин чтения

В библиотеке с открытым исходным кодом llama.cpp исправили умножение матриц с учётом MoE для Vulkan. Изменение корректирует выбор размеров тайлов для операции mat_mul_id, чтобы он соответствовал фактическому числу активных строк у каждого эксперта. В тесте на модели с 30 млрд параметров исправление сократило бесполезную нагрузку на GPU, на которую раньше приходилось 55% времени работы.

Почему это важно

Меньше простоя GPU — быстрее инференс крупных MoE-моделей на оборудовании, совместимом с Vulkan.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1ggml-org/llama.cpp b11265 ↗llama.cpp29 сент. 2026 г.<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 источников

Обновлено: ·Markdown·llms.txt