Il progetto llama.cpp ha pubblicato una nuova versione (b11513) l’Oct 8 2026. La nuova versione sostituisce la precedente routine CUDA top-k, eseguita riga per riga, con un algoritmo radix-select che opera su una griglia di righe. Sul modello Qwen‑4‑exp, con 34,816 token, la modifica riduce le chiamate top-k da 1,671,253 lanci (5,761.8 ms) a 2,329 lanci (941.8 ms). L’aggiornamento aggiunge anche la selezione automatica dell’algoritmo top-k più adatto in base alla forma della matrice e perfeziona le soglie per i percorsi bitonic e radix.
Perché conta
Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni su GPU Nvidia possono aspettarsi operazioni top-k circa sei volte più veloci, con vantaggi per l’inferenza e l’addestramento.