L’équipe ggml-org a publié llama.cpp b11515 le 2026-10-09. Cette mise à jour ajoute une multiplication matrice-vecteur quantifiée (MMVQ) avec réorganisation de la disposition Q5_K via SYCL, ainsi qu’un opérateur GLU fusionné, pour améliorer les performances sur le matériel compatible. La version inclut également des binaires prêts à l’emploi pour Apple Silicon, les Mac Intel, iOS, Ubuntu (CPU, Vulkan, CUDA 12.8) et IBM s390x. Les utilisateurs peuvent télécharger l’archive qui leur convient depuis la page GitHub.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter llama.cpp plus rapidement sur les GPU compatibles avec SYCL, sans avoir à compiler le code source.