Projektet llama.cpp släppte version b11476 den 7 oktober 2026. Den innehåller en generell MMA-kärna (matrix-multiply-accumulate) för ett mindre antal rader, med stöd för BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 och flera IQ-format. Kärnan aktiveras vid olika radantal: 5 rader för TQ2_0, 4 för BF16, 3 för MXFP4, Q2_0, Q2_K och IQ4_NL samt 2 för övriga format. På Apple M3 Ultra presterar den då bättre än de tidigare kärnorna. Benchmarktester visar att ändringen kortar körtiden från 0.98 s till 0.23 s vid gränsvärdet och förbättrar resultaten även för andra radantal.
Varför det spelar roll
Utvecklare kan köra kvantiserade Llama-modeller snabbare på Mac-datorer med M3 Ultra-chip, vilket minskar inferenstiden i appar.