# llama.cpp añade un kernel MMA para pocos renglones

> La actualización del 7 de oct. de 2026 amplía el kernel de Metal para admitir BF16, tipos Q y otros formatos, y acelera la multiplicación de matrices en dispositivos Apple M3 Ultra.

Oossa · 2026-10-07 · https://oossa.com/es/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

El proyecto llama.cpp publicó la versión b11476 el 7 de oct. de 2026. Incluye un kernel genérico MMA (multiplicación y acumulación de matrices) para pocos renglones, compatible con BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 y varios formatos IQ. El kernel se activa con distintas cantidades de renglones: 5 para TQ2_0, 4 para BF16, 3 para MXFP4, Q2_0, Q2_K e IQ4_NL, y 2 para los demás. En un Apple M3 Ultra, supera en rendimiento a los kernels anteriores. Las pruebas muestran que, al alcanzar esos umbrales, el cambio reduce los tiempos de 0.98 s a 0.23 s y también mejora los resultados en otros rangos de renglones.

## Los hechos

- La versión b11476 se publicó el 7 de oct. de 2026 ("Wed Oct 07 2026 16:55:09 GMT+0200").
- El kernel MMA para pocos renglones ahora admite BF16, tipos Q, MXFP4 y formatos IQ, y funciona más rápido en M3 Ultra.

## Por qué importa

Los desarrolladores pueden ejecutar modelos Llama cuantizados más rápido en Mac con chips M3 Ultra, lo que reduce el tiempo de inferencia de las aplicaciones.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Última actualización: 2026-10-07
