Oossa

llama.cpp adiciona kernel MMA para poucos rows e vários tipos quantizados

A atualização de 7 de outubro de 2026 amplia o kernel Metal para incluir BF16, tipos Q e outros formatos, acelerando a multiplicação de matrizes em dispositivos Apple M3 Ultra.

NotaPor Publicado pelo Oossa: 1 min de leitura

O projeto llama.cpp lançou a versão b11476 em 7 de outubro de 2026. A atualização adiciona um kernel genérico de MMA (multiplicação e acumulação de matrizes) para poucos rows, compatível com BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 e vários formatos IQ. O kernel entra em ação a partir de diferentes quantidades de rows — 5 para TQ2_0, 4 para BF16, 3 para MXFP4, Q2_0, Q2_K e IQ4_NL, e 2 para os demais — e supera os kernels anteriores em um Apple M3 Ultra. Os benchmarks mostram que a mudança acelera as operações de 0,23 s a 0,98 s no limite de rows e melhora os tempos em outras faixas.

Por que importa

Desenvolvedores podem executar modelos Llama quantizados mais rapidamente em Macs com chips M3 Ultra, reduzindo o tempo de inferência dos aplicativos.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.