El proyecto llama.cpp publicó la versión b11476 el 7 de oct. de 2026. Incluye un kernel genérico MMA (multiplicación y acumulación de matrices) para pocos renglones, compatible con BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 y varios formatos IQ. El kernel se activa con distintas cantidades de renglones: 5 para TQ2_0, 4 para BF16, 3 para MXFP4, Q2_0, Q2_K e IQ4_NL, y 2 para los demás. En un Apple M3 Ultra, supera en rendimiento a los kernels anteriores. Las pruebas muestran que, al alcanzar esos umbrales, el cambio reduce los tiempos de 0.98 s a 0.23 s y también mejora los resultados en otros rangos de renglones.
Por qué importa
Los desarrolladores pueden ejecutar modelos Llama cuantizados más rápido en Mac con chips M3 Ultra, lo que reduce el tiempo de inferencia de las aplicaciones.