# llama.cpp mejora la eficiencia de la multiplicación de matrices MoE

> La versión del 30 de septiembre de 2026 ajusta la selección de bloques de Vulkan y reduce el trabajo desperdiciado en modelos de mezcla de expertos.

Oossa · 2026-09-29 · https://oossa.com/es/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

La biblioteca de código abierto llama.cpp incorporó una corrección de Vulkan para la multiplicación de matrices adaptada a MoE. El cambio modifica la forma en que el código selecciona el tamaño de los bloques para la operación mat_mul_id, de modo que coincida con la cantidad real de filas activas por experto. En una prueba con un modelo de 30.000 millones de parámetros, la corrección redujo el trabajo inactivo de la GPU, que había representado el 55 % del tiempo de ejecución.

## Los hechos

- La versión b11265 se publicó el 30 de septiembre de 2026
- En la prueba con Sarvam 30B, el desperdicio de rendimiento cayó del 55 % a casi cero

## Por qué importa

Menos tiempo de inactividad de la GPU se traduce en inferencias más rápidas para modelos MoE grandes en hardware compatible con Vulkan.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Última actualización: 2026-09-29
