Oossa

llama.cpp får MMA-kärna för flera kvantiserade datatyper

Uppdateringen den 7 oktober 2026 utökar Metal-kärnan med stöd för BF16, Q-typer och fler format, vilket snabbar upp matrismultiplikation på Apple M3 Ultra-enheter.

NotisAv Publicerad av Oossa: 1 min läsning

Projektet llama.cpp släppte version b11476 den 7 oktober 2026. Den innehåller en generell MMA-kärna (matrix-multiply-accumulate) för ett mindre antal rader, med stöd för BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 och flera IQ-format. Kärnan aktiveras vid olika radantal: 5 rader för TQ2_0, 4 för BF16, 3 för MXFP4, Q2_0, Q2_K och IQ4_NL samt 2 för övriga format. På Apple M3 Ultra presterar den då bättre än de tidigare kärnorna. Benchmarktester visar att ändringen kortar körtiden från 0.98 s till 0.23 s vid gränsvärdet och förbättrar resultaten även för andra radantal.

Varför det spelar roll

Utvecklare kan köra kvantiserade Llama-modeller snabbare på Mac-datorer med M3 Ultra-chip, vilket minskar inferenstiden i appar.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.