La bibliothèque open source llama.cpp a publié la version b11505 le 2026-10-08. Cette mise à jour corrige un bug dans le shader Vulkan utilisé pour l’opération top-k. Auparavant, les valeurs +inf et NaN étaient ignorées, ce qui pouvait provoquer des blocages sur les GPU NVIDIA ou produire des indices incorrects sur les GPU AMD. Le correctif convertit NaN en -inf, élargit la plage des compartiments pour comptabiliser toutes les valeurs et corrige le traitement du cas k = 1 pour les nombres négatifs. Un nouveau test, nommé test_top_k_inf, vérifie ces cas.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp avec Vulkan constateront moins de plantages et obtiendront des résultats plus précis lors du classement des tokens, lorsque leurs prompts contiennent des valeurs flottantes extrêmes.