# llama.cpp ergänzt MMA-Kernel für quantisierte Datentypen

> Das Update vom 7. Okt. 2026 erweitert den Metal-Kernel um BF16, Q-Typen und weitere Formate. Auf Apple-Geräten mit M3 Ultra beschleunigt es Matrixmultiplikationen.

Oossa · 2026-10-07 · https://oossa.com/de/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

Das llama.cpp-Projekt hat am 7. Okt. 2026 Version b11476 veröffentlicht. Neu ist ein allgemeiner MMA-Kernel (Matrix Multiply-Accumulate) für wenige Zeilen, der mit BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 und mehreren IQ-Formaten funktioniert. Je nach Datentyp greift der Kernel ab einer anderen Zeilenzahl: ab 5 Zeilen für TQ2_0, ab 4 für BF16, ab 3 für MXFP4, Q2_0, Q2_K und IQ4_NL sowie ab 2 für die übrigen Formate. Auf einem Apple M3 Ultra ist er schneller als die bisherigen Kernel. Benchmarks zeigen, dass sich die Laufzeit bei Erreichen dieser Schwellenwerte von 0,23 auf 0,98 s verkürzt und sich auch in anderen Zeilenbereichen verbessert.

## Die Fakten

- Version b11476 wurde am 7. Okt. 2026 veröffentlicht ("Wed Oct 07 2026 16:55:09 GMT+0200").
- Der MMA-Kernel für wenige Zeilen unterstützt jetzt BF16, Q-Typen, MXFP4 und IQ-Formate und läuft auf einem M3 Ultra schneller.

## Warum es wichtig ist

Entwickler können quantisierte Llama-Modelle auf Macs mit M3-Ultra-Chips schneller ausführen und so die Inferenzzeit für Anwendungen verkürzen.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Zuletzt aktualisiert: 2026-10-07
