L’équipe ggml-org a publié la version b11540 de llama.cpp le 10 oct. 2026. Cette mise à jour ajoute la prise en charge de SYCL pour accélérer les modèles mixture-of-experts (MoE) MXFP4 grâce au décodage arithmétique et au réordonnancement des poids. Elle comprend aussi des binaires précompilés pour les Mac à puce Apple Silicon, les Mac Intel, iOS et plusieurs variantes d’Ubuntu (CPU, Vulkan et CUDA). Les modifications sont répertoriées sous le tag b11540 sur GitHub.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter plus rapidement des modèles MoE de plus grande taille sur les GPU compatibles avec SYCL, ce qui élargit les possibilités matérielles des utilisateurs de llama.cpp.