L’équipe ggml-org a publié une nouvelle version de llama.cpp le 30 septembre 2026. Cette version corrige un problème qui survenait lorsque le pilote de GPU MUSA ne définissait pas CUDA_ARCH, ce qui pouvait entraîner la compilation de certains noyaux à vide. Le correctif ajoute la détection adéquate de l’architecture et supprime des vérifications redondantes. La version comprend également de nombreux binaires précompilés, désormais compatibles avec CUDA 12.8 et 13.4 sous Linux et Windows, ainsi qu’avec diverses plateformes ARM et Apple Silicon.
Pourquoi c'est important
Les développeurs peuvent désormais utiliser Llama.cpp avec des GPU MUSA et les versions récentes de CUDA, sans correctifs manuels.