Het llama.cpp-project bracht op 7 okt 2026 versie b11476 uit. De update voegt een generieke MMA-kernel (matrixvermenigvuldiging en accumulatie) toe die met enkele rijen tegelijk werkt en BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 en verschillende IQ-formaten ondersteunt. De kernel wordt vanaf verschillende aantallen rijen ingezet: bij 5 rijen voor TQ2_0, 4 voor BF16, 3 voor MXFP4, Q2_0, Q2_K en IQ4_NL, en 2 voor de overige formaten. Op een Apple M3 Ultra presteert hij dan beter dan de eerdere kernels. Benchmarks laten zien dat de wijziging de uitvoeringstijd bij die drempel terugbrengt van 0,98 s naar 0,23 s en ook bij andere aantallen rijen voor betere tijden zorgt.
Waarom het ertoe doet
Ontwikkelaars kunnen gekwantiseerde Llama-modellen sneller draaien op Macs met een M3 Ultra-chip, waardoor applicaties minder tijd nodig hebben voor inferentie.