L’équipe ggml-org a publié llama.cpp version b11391 le 4 octobre 2026. La mise à jour déplace une variable CUDA appelée blocks_per_col à l’endroit où elle est utilisée. Cette modification a été validée par Adrien Gallouët. La version inclut également de nouveaux binaires précompilés pour macOS sur Apple Silicon, macOS sur processeur Intel, iOS et plusieurs versions d’Ubuntu (CPU, Vulkan et CUDA 12). Tous les fichiers sont téléchargeables depuis la page de la version sur GitHub.
Pourquoi c'est important
Les développeurs peuvent désormais utiliser llama.cpp sur davantage de matériel sans configuration préalable, notamment ceux qui disposent de GPU compatibles CUDA.