Das llama.cpp-Projekt hat am 7. Okt. 2026 Version b11476 veröffentlicht. Neu ist ein allgemeiner MMA-Kernel (Matrix Multiply-Accumulate) für wenige Zeilen, der mit BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 und mehreren IQ-Formaten funktioniert. Je nach Datentyp greift der Kernel ab einer anderen Zeilenzahl: ab 5 Zeilen für TQ2_0, ab 4 für BF16, ab 3 für MXFP4, Q2_0, Q2_K und IQ4_NL sowie ab 2 für die übrigen Formate. Auf einem Apple M3 Ultra ist er schneller als die bisherigen Kernel. Benchmarks zeigen, dass sich die Laufzeit bei Erreichen dieser Schwellenwerte von 0,23 auf 0,98 s verkürzt und sich auch in anderen Zeilenbereichen verbessert.
Warum es wichtig ist
Entwickler können quantisierte Llama-Modelle auf Macs mit M3-Ultra-Chips schneller ausführen und so die Inferenzzeit für Anwendungen verkürzen.