# llama.cpp adiciona kernel MMA para poucos rows e vários tipos quantizados

> A atualização de 7 de outubro de 2026 amplia o kernel Metal para incluir BF16, tipos Q e outros formatos, acelerando a multiplicação de matrizes em dispositivos Apple M3 Ultra.

Oossa · 2026-10-07 · https://oossa.com/pt/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

O projeto llama.cpp lançou a versão b11476 em 7 de outubro de 2026. A atualização adiciona um kernel genérico de MMA (multiplicação e acumulação de matrizes) para poucos rows, compatível com BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 e vários formatos IQ. O kernel entra em ação a partir de diferentes quantidades de rows — 5 para TQ2_0, 4 para BF16, 3 para MXFP4, Q2_0, Q2_K e IQ4_NL, e 2 para os demais — e supera os kernels anteriores em um Apple M3 Ultra. Os benchmarks mostram que a mudança acelera as operações de 0,23 s a 0,98 s no limite de rows e melhora os tempos em outras faixas.

## Os fatos

- A versão b11476 foi publicada em 7 de outubro de 2026 ("Wed Oct 07 2026 16:55:09 GMT+0200").
- O kernel MMA para poucos rows agora é compatível com BF16, tipos Q, MXFP4 e formatos IQ, e é mais rápido no M3 Ultra.

## Por que importa

Desenvolvedores podem executar modelos Llama quantizados mais rapidamente em Macs com chips M3 Ultra, reduzindo o tempo de inferência dos aplicativos.

## Fontes e referências

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Última atualização: 2026-10-07
