Le projet llama.cpp a publié la version b11476 le 7 octobre 2026. Elle ajoute un noyau générique MMA (accumulation de produits matriciels) pour quelques lignes, compatible avec BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 et plusieurs formats IQ. Le noyau s’active à partir de différents nombres de lignes — 5 pour TQ2_0, 4 pour BF16, 3 pour MXFP4, Q2_0, Q2_K et IQ4_NL, et 2 pour les autres formats — et dépasse alors les performances des noyaux précédents sur un Apple M3 Ultra. Les tests montrent que cette modification accélère les opérations, avec des temps passant de 0,23 s à 0,98 s au seuil, et améliore également les performances pour d’autres nombres de lignes.
Pourquoi c'est important
Les développeurs peuvent exécuter plus rapidement des modèles Llama quantifiés sur les Mac équipés de puces M3 Ultra, ce qui réduit le temps d’inférence des applications.