L’équipe ggml‑org a publié llama.cpp version b11534 le 2026-10-09. Cette mise à jour intègre les copies d’instantanés d’état au cache récurrent et supprime des copies CUDA supplémentaires lorsque K = 1, un cas de décodage non spéculatif. Ce changement concerne uniquement le backend CUDA : les versions pour CPU et Vulkan ne sont donc pas modifiées. Des binaires précompilés pour macOS, iOS et plusieurs variantes d’Ubuntu sont disponibles au téléchargement.
Les utilisateurs de la version CUDA devraient constater une légère baisse du trafic mémoire GPU, ce qui peut accélérer le traitement sur le matériel compatible.
Pourquoi c'est important
Les utilisateurs de CUDA pourraient bénéficier d’une inférence plus rapide, car la bibliothèque transfère désormais moins de données sur le GPU.