# llama.cpp introduce un kernel MMA per più tipi quantizzati

> L’aggiornamento del 7 ott 2026 estende il kernel Metal a BF16, ai tipi Q e ad altri formati, accelerando la moltiplicazione di matrici sui dispositivi Apple M3 Ultra.

Oossa · 2026-10-07 · https://oossa.com/it/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

Il progetto llama.cpp ha rilasciato la versione b11476 il 7 ott 2026. La novità è un kernel MMA (matrix-multiply-accumulate, ovvero moltiplicazione di matrici con accumulo) generico per poche righe, compatibile con BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 e diversi formati IQ. Il kernel entra in funzione con un numero di righe che varia a seconda del formato: 5 per TQ2_0, 4 per BF16, 3 per MXFP4, Q2_0, Q2_K e IQ4_NL, e 2 per gli altri. Su Apple M3 Ultra supera i kernel precedenti. I benchmark mostrano che, alla soglia prevista per ciascun formato, la modifica riduce i tempi di esecuzione da 0,23 s a 0,98 s e migliora le prestazioni anche con altri numeri di righe.

## I fatti

- La versione b11476 è stata pubblicata il 7 ott 2026 ("Wed Oct 07 2026 16:55:09 GMT+0200").
- Il nuovo kernel MMA per poche righe supporta BF16, tipi Q, MXFP4 e formati IQ, e gira più velocemente su M3 Ultra.

## Perché conta

Gli sviluppatori possono eseguire più velocemente sui Mac con chip M3 Ultra i modelli Llama quantizzati, riducendo i tempi di inferenza delle applicazioni.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Ultimo aggiornamento: 2026-10-07
