Oossa

llama.cpp accélère la sélection CUDA top-k

La bibliothèque open source llama.cpp utilise désormais un algorithme radix-select pour le top-k sur CUDA, ramenant le temps d’exécution de 5.76 s à 0.94 s lors d’un test de grande ampleur.

BrèvePar Publié par Oossa: 1 min de lecture

Le projet llama.cpp a publié une nouvelle version (b11513) le 8 oct. 2026. Celle-ci remplace l’ancienne routine CUDA top-k exécutée ligne par ligne par une sélection radix répartie sur une grille de lignes. Avec le modèle Qwen‑4‑exp et 34,816 tokens, cette modification fait passer le nombre de lancements d’appels top-k de 1,671,253 (5,761.8 ms) à 2,329 (941.8 ms). La mise à jour ajoute également la sélection automatique du meilleur algorithme top-k en fonction de la forme de la matrice et affine les seuils des méthodes bitonic et radix.

Pourquoi c'est important

Les développeurs qui exécutent de grands modèles de langage sur des GPU Nvidia peuvent s’attendre à des opérations top-k environ six fois plus rapides, ce qui accélère l’inférence et l’entraînement.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.