Oossa

llama.cpp versnelt matrixvermenigvuldiging op M3 Ultra

De update van 7 okt 2026 breidt de Metal-kernel uit met ondersteuning voor BF16, Q-types en andere formaten.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het llama.cpp-project bracht op 7 okt 2026 versie b11476 uit. De update voegt een generieke MMA-kernel (matrixvermenigvuldiging en accumulatie) toe die met enkele rijen tegelijk werkt en BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 en verschillende IQ-formaten ondersteunt. De kernel wordt vanaf verschillende aantallen rijen ingezet: bij 5 rijen voor TQ2_0, 4 voor BF16, 3 voor MXFP4, Q2_0, Q2_K en IQ4_NL, en 2 voor de overige formaten. Op een Apple M3 Ultra presteert hij dan beter dan de eerdere kernels. Benchmarks laten zien dat de wijziging de uitvoeringstijd bij die drempel terugbrengt van 0,98 s naar 0,23 s en ook bij andere aantallen rijen voor betere tijden zorgt.

Waarom het ertoe doet

Ontwikkelaars kunnen gekwantiseerde Llama-modellen sneller draaien op Macs met een M3 Ultra-chip, waardoor applicaties minder tijd nodig hebben voor inferentie.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.