# llama.cpp versnelt matrixvermenigvuldiging op M3 Ultra

> De update van 7 okt 2026 breidt de Metal-kernel uit met ondersteuning voor BF16, Q-types en andere formaten.

Oossa · 2026-10-07 · https://oossa.com/nl/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

Het llama.cpp-project bracht op 7 okt 2026 versie b11476 uit. De update voegt een generieke MMA-kernel (matrixvermenigvuldiging en accumulatie) toe die met enkele rijen tegelijk werkt en BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 en verschillende IQ-formaten ondersteunt. De kernel wordt vanaf verschillende aantallen rijen ingezet: bij 5 rijen voor TQ2_0, 4 voor BF16, 3 voor MXFP4, Q2_0, Q2_K en IQ4_NL, en 2 voor de overige formaten. Op een Apple M3 Ultra presteert hij dan beter dan de eerdere kernels. Benchmarks laten zien dat de wijziging de uitvoeringstijd bij die drempel terugbrengt van 0,98 s naar 0,23 s en ook bij andere aantallen rijen voor betere tijden zorgt.

## De feiten

- Versie b11476 verscheen op 7 okt 2026 ("Wed Oct 07 2026 16:55:09 GMT+0200").
- De MMA-kernel voor een klein aantal rijen ondersteunt nu BF16, Q-types, MXFP4 en IQ-formaten en werkt sneller op de M3 Ultra.

## Waarom het ertoe doet

Ontwikkelaars kunnen gekwantiseerde Llama-modellen sneller draaien op Macs met een M3 Ultra-chip, waardoor applicaties minder tijd nodig hebben voor inferentie.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Laatst bijgewerkt: 2026-10-07
