O projeto llama.cpp lançou a versão b11476 em 7 de outubro de 2026. A atualização adiciona um kernel genérico de MMA (multiplicação e acumulação de matrizes) para poucos rows, compatível com BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 e vários formatos IQ. O kernel entra em ação a partir de diferentes quantidades de rows — 5 para TQ2_0, 4 para BF16, 3 para MXFP4, Q2_0, Q2_K e IQ4_NL, e 2 para os demais — e supera os kernels anteriores em um Apple M3 Ultra. Os benchmarks mostram que a mudança acelera as operações de 0,23 s a 0,98 s no limite de rows e melhora os tempos em outras faixas.
Por que importa
Desenvolvedores podem executar modelos Llama quantizados mais rapidamente em Macs com chips M3 Ultra, reduzindo o tempo de inferência dos aplicativos.