# llama.cpp får MMA-kärna för flera kvantiserade datatyper

> Uppdateringen den 7 oktober 2026 utökar Metal-kärnan med stöd för BF16, Q-typer och fler format, vilket snabbar upp matrismultiplikation på Apple M3 Ultra-enheter.

Oossa · 2026-10-07 · https://oossa.com/sv/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

Projektet llama.cpp släppte version b11476 den 7 oktober 2026. Den innehåller en generell MMA-kärna (matrix-multiply-accumulate) för ett mindre antal rader, med stöd för BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 och flera IQ-format. Kärnan aktiveras vid olika radantal: 5 rader för TQ2_0, 4 för BF16, 3 för MXFP4, Q2_0, Q2_K och IQ4_NL samt 2 för övriga format. På Apple M3 Ultra presterar den då bättre än de tidigare kärnorna. Benchmarktester visar att ändringen kortar körtiden från 0.98 s till 0.23 s vid gränsvärdet och förbättrar resultaten även för andra radantal.

## Fakta

- Version b11476 släpptes den 7 oktober 2026 (”Wed Oct 07 2026 16:55:09 GMT+0200”).
- Den nya MMA-kärnan för ett mindre antal rader stöder BF16, Q-typer, MXFP4 och IQ-format och är snabbare på M3 Ultra.

## Varför det spelar roll

Utvecklare kan köra kvantiserade Llama-modeller snabbare på Mac-datorer med M3 Ultra-chip, vilket minskar inferenstiden i appar.

## Källor och referenser

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Senast uppdaterad: 2026-10-07
