# llama.cpp ajoute un noyau MMA pour plusieurs types quantifiés

> La mise à jour du 7 octobre 2026 étend le noyau Metal à BF16, aux types Q et à d’autres formats, et accélère les multiplications matricielles sur les appareils Apple M3 Ultra.

Oossa · 2026-10-07 · https://oossa.com/fr/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

Le projet llama.cpp a publié la version b11476 le 7 octobre 2026. Elle ajoute un noyau générique MMA (accumulation de produits matriciels) pour quelques lignes, compatible avec BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 et plusieurs formats IQ. Le noyau s’active à partir de différents nombres de lignes — 5 pour TQ2_0, 4 pour BF16, 3 pour MXFP4, Q2_0, Q2_K et IQ4_NL, et 2 pour les autres formats — et dépasse alors les performances des noyaux précédents sur un Apple M3 Ultra. Les tests montrent que cette modification accélère les opérations, avec des temps passant de 0,23 s à 0,98 s au seuil, et améliore également les performances pour d’autres nombres de lignes.

## Les faits

- La version b11476 a été publiée le 7 octobre 2026 (« Wed Oct 07 2026 16:55:09 GMT+0200 »).
- Le noyau MMA pour quelques lignes prend désormais en charge BF16, les types Q, MXFP4 et les types IQ, et fonctionne plus rapidement sur M3 Ultra.

## Pourquoi c'est important

Les développeurs peuvent exécuter plus rapidement des modèles Llama quantifiés sur les Mac équipés de puces M3 Ultra, ce qui réduit le temps d’inférence des applications.

## Sources et références

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Dernière mise à jour: 2026-10-07
