L’équipe ggml‑org a publié llama.cpp version b11493 le 8 oct. 2026. Cette mise à jour ajoute une implémentation SYCL du GEMM XMX groupé pour les modèles Mixture‑of‑Experts (MoE), une opération de multiplication matricielle utilisée dans les grands modèles de langage. La version comprend également des binaires précompilés pour macOS, iOS et Ubuntu (CPU, Vulkan et CUDA).
Pourquoi c'est important
Les développeurs peuvent désormais exécuter des modèles basés sur l’architecture MoE sur des GPU compatibles avec SYCL, ce qui élargit le choix de matériel pour les charges de travail LLM open source.