# llama.cpp accélère la sélection CUDA top-k

> La bibliothèque open source llama.cpp utilise désormais un algorithme radix-select pour le top-k sur CUDA, ramenant le temps d’exécution de 5.76 s à 0.94 s lors d’un test de grande ampleur.

Oossa · 2026-10-08 · https://oossa.com/fr/llama-cpp-adds-faster-cuda-top-k-selection

Le projet llama.cpp a publié une nouvelle version (b11513) le 8 oct. 2026. Celle-ci remplace l’ancienne routine CUDA top-k exécutée ligne par ligne par une sélection radix répartie sur une grille de lignes. Avec le modèle Qwen‑4‑exp et 34,816 tokens, cette modification fait passer le nombre de lancements d’appels top-k de 1,671,253 (5,761.8 ms) à 2,329 (941.8 ms). La mise à jour ajoute également la sélection automatique du meilleur algorithme top-k en fonction de la forme de la matrice et affine les seuils des méthodes bitonic et radix.

## Les faits

- Date de publication : 8 oct. 2026 – « PUBLISHED: Thu Oct 08 2026 »
- Baisse du temps d’exécution avec Qwen‑4‑exp : de 5,761.8 ms à 941.8 ms

## Pourquoi c'est important

Les développeurs qui exécutent de grands modèles de langage sur des GPU Nvidia peuvent s’attendre à des opérations top-k environ six fois plus rapides, ce qui accélère l’inférence et l’entraînement.

## Sources et références

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Dernière mise à jour: 2026-10-08
