OossaLa IA avanza rápido. Te lo explicamos de forma sencilla.

llama.cpp mejora la eficiencia de la multiplicación de matrices MoE

La versión del 30 de septiembre de 2026 ajusta la selección de bloques de Vulkan y reduce el trabajo desperdiciado en modelos de mezcla de expertos.

BreveOossa1 min de lectura

La biblioteca de código abierto llama.cpp incorporó una corrección de Vulkan para la multiplicación de matrices adaptada a MoE. El cambio modifica la forma en que el código selecciona el tamaño de los bloques para la operación mat_mul_id, de modo que coincida con la cantidad real de filas activas por experto. En una prueba con un modelo de 30.000 millones de parámetros, la corrección redujo el trabajo inactivo de la GPU, que había representado el 55 % del tiempo de ejecución.

Por qué importa

Menos tiempo de inactividad de la GPU se traduce en inferencias más rápidas para modelos MoE grandes en hardware compatible con Vulkan.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.

Fuentes y referencias

#FuenteMedioFechaIdea clave
1ggml-org/llama.cpp b11265 ↗llama.cpp29 sept 2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 fuentes

Última actualización: ·Markdown·llms.txt