Oossa

llama.cpp ajoute un noyau MMA pour plusieurs types quantifiés

La mise à jour du 7 octobre 2026 étend le noyau Metal à BF16, aux types Q et à d’autres formats, et accélère les multiplications matricielles sur les appareils Apple M3 Ultra.

BrèvePar Publié par Oossa: 1 min de lecture

Le projet llama.cpp a publié la version b11476 le 7 octobre 2026. Elle ajoute un noyau générique MMA (accumulation de produits matriciels) pour quelques lignes, compatible avec BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 et plusieurs formats IQ. Le noyau s’active à partir de différents nombres de lignes — 5 pour TQ2_0, 4 pour BF16, 3 pour MXFP4, Q2_0, Q2_K et IQ4_NL, et 2 pour les autres formats — et dépasse alors les performances des noyaux précédents sur un Apple M3 Ultra. Les tests montrent que cette modification accélère les opérations, avec des temps passant de 0,23 s à 0,98 s au seuil, et améliore également les performances pour d’autres nombres de lignes.

Pourquoi c'est important

Les développeurs peuvent exécuter plus rapidement des modèles Llama quantifiés sur les Mac équipés de puces M3 Ultra, ce qui réduit le temps d’inférence des applications.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.