Oossa

llama.cpp añade un kernel MMA para pocos renglones

La actualización del 7 de oct. de 2026 amplía el kernel de Metal para admitir BF16, tipos Q y otros formatos, y acelera la multiplicación de matrices en dispositivos Apple M3 Ultra.

BrevePor Publicado por Oossa: 1 min de lectura

El proyecto llama.cpp publicó la versión b11476 el 7 de oct. de 2026. Incluye un kernel genérico MMA (multiplicación y acumulación de matrices) para pocos renglones, compatible con BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 y varios formatos IQ. El kernel se activa con distintas cantidades de renglones: 5 para TQ2_0, 4 para BF16, 3 para MXFP4, Q2_0, Q2_K e IQ4_NL, y 2 para los demás. En un Apple M3 Ultra, supera en rendimiento a los kernels anteriores. Las pruebas muestran que, al alcanzar esos umbrales, el cambio reduce los tiempos de 0.98 s a 0.23 s y también mejora los resultados en otros rangos de renglones.

Por qué importa

Los desarrolladores pueden ejecutar modelos Llama cuantizados más rápido en Mac con chips M3 Ultra, lo que reduce el tiempo de inferencia de las aplicaciones.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.