Oossa

llama.cpp accelera la selezione top-k su CUDA

La libreria open source Llama.cpp adotta un algoritmo radix-select per il top-k su CUDA, riducendo i tempi da 5.76 s a 0.94 s in un test su larga scala.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il progetto llama.cpp ha pubblicato una nuova versione (b11513) l’Oct 8 2026. La nuova versione sostituisce la precedente routine CUDA top-k, eseguita riga per riga, con un algoritmo radix-select che opera su una griglia di righe. Sul modello Qwen‑4‑exp, con 34,816 token, la modifica riduce le chiamate top-k da 1,671,253 lanci (5,761.8 ms) a 2,329 lanci (941.8 ms). L’aggiornamento aggiunge anche la selezione automatica dell’algoritmo top-k più adatto in base alla forma della matrice e perfeziona le soglie per i percorsi bitonic e radix.

Perché conta

Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni su GPU Nvidia possono aspettarsi operazioni top-k circa sei volte più veloci, con vantaggi per l’inferenza e l’addestramento.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.