Il progetto llama.cpp ha rilasciato la versione b11476 il 7 ott 2026. La novità è un kernel MMA (matrix-multiply-accumulate, ovvero moltiplicazione di matrici con accumulo) generico per poche righe, compatibile con BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 e diversi formati IQ. Il kernel entra in funzione con un numero di righe che varia a seconda del formato: 5 per TQ2_0, 4 per BF16, 3 per MXFP4, Q2_0, Q2_K e IQ4_NL, e 2 per gli altri. Su Apple M3 Ultra supera i kernel precedenti. I benchmark mostrano che, alla soglia prevista per ciascun formato, la modifica riduce i tempi di esecuzione da 0,23 s a 0,98 s e migliora le prestazioni anche con altri numeri di righe.
Perché conta
Gli sviluppatori possono eseguire più velocemente sui Mac con chip M3 Ultra i modelli Llama quantizzati, riducendo i tempi di inferenza delle applicazioni.