L’équipe ggml-org a publié llama.cpp b11499 le 8 octobre 2026. Cette mise à jour modifie le backend CUDA pour utiliser des pas en octets lors de l’opération roll, ce qui permet au GPU de traiter correctement les données non contiguës. La version comprend également de nouveaux binaires pour Apple Silicon, les Mac Intel, iOS et plusieurs versions d’Ubuntu (CPU, Vulkan et CUDA 12). Tous les fichiers sont disponibles sur la page de la version sur GitHub.
Pourquoi c'est important
Les développeurs peuvent utiliser llama.cpp sur davantage de configurations GPU sans rencontrer d’erreurs, ce qui élargit les possibilités d’exécuter des LLM localement sur des ordinateurs de bureau et des serveurs.