Le projet llama.cpp a publié une nouvelle version (b11513) le 8 oct. 2026. Celle-ci remplace l’ancienne routine CUDA top-k exécutée ligne par ligne par une sélection radix répartie sur une grille de lignes. Avec le modèle Qwen‑4‑exp et 34,816 tokens, cette modification fait passer le nombre de lancements d’appels top-k de 1,671,253 (5,761.8 ms) à 2,329 (941.8 ms). La mise à jour ajoute également la sélection automatique du meilleur algorithme top-k en fonction de la forme de la matrice et affine les seuils des méthodes bitonic et radix.
Pourquoi c'est important
Les développeurs qui exécutent de grands modèles de langage sur des GPU Nvidia peuvent s’attendre à des opérations top-k environ six fois plus rapides, ce qui accélère l’inférence et l’entraînement.