# Обновление llama.cpp ускоряет умножение матриц в MoE

> В релизе от 30 сентября 2026 года изменён выбор размеров тайлов в Vulkan, что сокращает лишнюю работу в моделях Mixture-of-Experts.

Oossa · 2026-09-29 · https://oossa.com/ru/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

В библиотеке с открытым исходным кодом llama.cpp исправили умножение матриц с учётом MoE для Vulkan. Изменение корректирует выбор размеров тайлов для операции mat_mul_id, чтобы он соответствовал фактическому числу активных строк у каждого эксперта. В тесте на модели с 30 млрд параметров исправление сократило бесполезную нагрузку на GPU, на которую раньше приходилось 55% времени работы.

## Факты

- Релиз версии b11265 опубликован 30 сентября 2026 года
- В тесте Sarvam 30B доля бесполезной нагрузки снизилась с 55% почти до нуля

## Почему это важно

Меньше простоя GPU — быстрее инференс крупных MoE-моделей на оборудовании, совместимом с Vulkan.

## Источники и ссылки

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Обновлено: 2026-09-29
