L’équipe ggml‑org a publié llama.cpp version b11510 le 8 oct. 2026. Cette version ajoute à CUDA un noyau PAD en boucle, permettant à la bibliothèque de traiter des tenseurs de plus de 65 000 lignes ou tranches. Elle comprend également des binaires précompilés pour Apple Silicon, les Mac Intel, iOS et plusieurs versions d’Ubuntu (CPU, Vulkan et CUDA 12.8). Le code et les attestations sont accessibles depuis la page GitHub.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter des modèles de langage plus volumineux sur des GPU NVIDIA sans se heurter à l’ancienne limite de lignes.