# llama.cpp accelera la selezione top-k su CUDA

> La libreria open source Llama.cpp adotta un algoritmo radix-select per il top-k su CUDA, riducendo i tempi da 5.76 s a 0.94 s in un test su larga scala.

Oossa · 2026-10-08 · https://oossa.com/it/llama-cpp-adds-faster-cuda-top-k-selection

Il progetto llama.cpp ha pubblicato una nuova versione (b11513) l’Oct 8 2026. La nuova versione sostituisce la precedente routine CUDA top-k, eseguita riga per riga, con un algoritmo radix-select che opera su una griglia di righe. Sul modello Qwen‑4‑exp, con 34,816 token, la modifica riduce le chiamate top-k da 1,671,253 lanci (5,761.8 ms) a 2,329 lanci (941.8 ms). L’aggiornamento aggiunge anche la selezione automatica dell’algoritmo top-k più adatto in base alla forma della matrice e perfeziona le soglie per i percorsi bitonic e radix.

## I fatti

- Data di pubblicazione: Oct 8 2026 – "PUBLISHED: Thu Oct 08 2026"
- Riduzione dei tempi su Qwen‑4‑exp: da 5,761.8 ms a 941.8 ms

## Perché conta

Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni su GPU Nvidia possono aspettarsi operazioni top-k circa sei volte più veloci, con vantaggi per l’inferenza e l’addestramento.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Ultimo aggiornamento: 2026-10-08
