Le projet llama.cpp a publié la version b11509 le 8 oct. 2026. Elle corrige une vérification CUDA qui prenait à tort la version 4.x de CCCL pour une version antérieure, entraînant une baisse de performances silencieuse pour l’opération argsort. Le correctif remplace la comparaison composant par composant par une comparaison d’un entier compact, rétablissant ainsi le chemin rapide utilisant un itérateur à pas. Le changement a été testé sur une RTX 4070 avec CUDA 13.4 et a réussi tous les tests des backends.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp avec des configurations CUDA récentes bénéficieront d’un tri plus rapide sans avoir à modifier leur code.