Oossa

llama.cpp introduce un kernel MMA per più tipi quantizzati

L’aggiornamento del 7 ott 2026 estende il kernel Metal a BF16, ai tipi Q e ad altri formati, accelerando la moltiplicazione di matrici sui dispositivi Apple M3 Ultra.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il progetto llama.cpp ha rilasciato la versione b11476 il 7 ott 2026. La novità è un kernel MMA (matrix-multiply-accumulate, ovvero moltiplicazione di matrici con accumulo) generico per poche righe, compatibile con BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 e diversi formati IQ. Il kernel entra in funzione con un numero di righe che varia a seconda del formato: 5 per TQ2_0, 4 per BF16, 3 per MXFP4, Q2_0, Q2_K e IQ4_NL, e 2 per gli altri. Su Apple M3 Ultra supera i kernel precedenti. I benchmark mostrano che, alla soglia prevista per ciascun formato, la modifica riduce i tempi di esecuzione da 0,23 s a 0,98 s e migliora le prestazioni anche con altri numeri di righe.

Perché conta

Gli sviluppatori possono eseguire più velocemente sui Mac con chip M3 Ultra i modelli Llama quantizzati, riducendo i tempi di inferenza delle applicazioni.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.