L’équipe ggml-org a publié llama.cpp version b11498 le 2026-10-08. Cette mise à jour corrige un problème de noyau CUDA qui survenait lorsque certaines dimensions de tenseur dépassaient les limites de la grille du GPU. Elle comprend également de nouveaux binaires précompilés pour Apple Silicon, les Mac Intel, iOS et plusieurs configurations Ubuntu, notamment des versions CPU, Vulkan et CUDA 12.8.
Pourquoi c'est important
Les développeurs peuvent désormais utiliser llama.cpp sur davantage de configurations GPU sans plantage et télécharger des binaires prêts à l’emploi pour leur plateforme.