# llama.cpp b11494 optimise les warps CUDA

> La bibliothèque open source llama.cpp utilise désormais quatre colonnes d’état GDN par warp CUDA, pour de meilleures performances GPU.

Oossa · 2026-10-08 · https://oossa.com/fr/llama-cpp-release-b11494-adds-cuda-warp-optimizations

L’équipe ggml-org a publié la version b11494 de llama.cpp. Cette mise à jour modifie le backend CUDA : chaque warp traite désormais quatre colonnes d’état GDN au lieu de deux. Ce réglage est maintenant activé par défaut. Des binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu sont disponibles au téléchargement.

## Les faits

- Le tag de la version b11494 a été publié le 2026-10-08
- La valeur par défaut de cols_per_warp pour CUDA est désormais de 4

## Pourquoi c'est important

Les développeurs qui utilisent llama.cpp sur des GPU NVIDIA peuvent s’attendre à une inférence plus rapide, sans modifier leur code.

## Sources et références

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

Dernière mise à jour: 2026-10-08
