# llama.cpp v0.1.11534 optimise les copies CUDA

> La bibliothèque open source d’inférence LLaMA supprime des transferts mémoire GPU redondants, réduisant la charge pour certaines tâches.

Oossa · 2026-10-09 · https://oossa.com/fr/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

L’équipe ggml‑org a publié llama.cpp version b11534 le 2026-10-09. Cette mise à jour intègre les copies d’instantanés d’état au cache récurrent et supprime des copies CUDA supplémentaires lorsque K = 1, un cas de décodage non spéculatif. Ce changement concerne uniquement le backend CUDA : les versions pour CPU et Vulkan ne sont donc pas modifiées. Des binaires précompilés pour macOS, iOS et plusieurs variantes d’Ubuntu sont disponibles au téléchargement.

Les utilisateurs de la version CUDA devraient constater une légère baisse du trafic mémoire GPU, ce qui peut accélérer le traitement sur le matériel compatible.

## Les faits

- La version b11534 a été publiée le 2026-10-09
- La suppression des copies CUDA s’applique lorsque K = 1 (décodage non spéculatif)

## Pourquoi c'est important

Les utilisateurs de CUDA pourraient bénéficier d’une inférence plus rapide, car la bibliothèque transfère désormais moins de données sur le GPU.

## Sources et références

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Dernière mise à jour: 2026-10-09
