Oossa

llama.cpp v0.1.11534 optimise les copies CUDA

La bibliothèque open source d’inférence LLaMA supprime des transferts mémoire GPU redondants, réduisant la charge pour certaines tâches.

BrèvePar Publié par Oossa: 1 min de lecture

L’équipe ggml‑org a publié llama.cpp version b11534 le 2026-10-09. Cette mise à jour intègre les copies d’instantanés d’état au cache récurrent et supprime des copies CUDA supplémentaires lorsque K = 1, un cas de décodage non spéculatif. Ce changement concerne uniquement le backend CUDA : les versions pour CPU et Vulkan ne sont donc pas modifiées. Des binaires précompilés pour macOS, iOS et plusieurs variantes d’Ubuntu sont disponibles au téléchargement.

Les utilisateurs de la version CUDA devraient constater une légère baisse du trafic mémoire GPU, ce qui peut accélérer le traitement sur le matériel compatible.

Pourquoi c'est important

Les utilisateurs de CUDA pourraient bénéficier d’une inférence plus rapide, car la bibliothèque transfère désormais moins de données sur le GPU.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.