Das llama.cpp-Projekt hat am 8. Oktober 2026 eine neue Version (b11513) veröffentlicht. Sie ersetzt das bisherige zeilenweise CUDA-Top-k-Verfahren durch eine Radix-Auswahl, die zeilenweise über ein Grid ausgeführt wird. Beim Modell Qwen‑4‑exp mit 34,816 Tokens sinkt dadurch die Zahl der Top-k-Aufrufe von 1,671,253 Starts (5,761.8 ms) auf 2,329 Starts (941.8 ms). Das Update wählt außerdem automatisch den besten Top-k-Algorithmus anhand der Matrixform aus und passt die Schwellenwerte für Bitonic- und Radix-Verfahren an.
Warum es wichtig ist
Wer große Sprachmodelle auf Nvidia-GPUs ausführt, kann mit etwa sechsmal schnelleren Top-k-Operationen rechnen. Das beschleunigt Inferenz und Training.