Oossa

llama.cpp beschleunigt CUDA-Top-k-Auswahl

Die Open-Source-Bibliothek Llama.cpp nutzt für CUDA-Top-k jetzt einen Radix-Select-Algorithmus. In einem großen Test sinkt die Laufzeit von 5.76 s auf 0.94 s.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das llama.cpp-Projekt hat am 8. Oktober 2026 eine neue Version (b11513) veröffentlicht. Sie ersetzt das bisherige zeilenweise CUDA-Top-k-Verfahren durch eine Radix-Auswahl, die zeilenweise über ein Grid ausgeführt wird. Beim Modell Qwen‑4‑exp mit 34,816 Tokens sinkt dadurch die Zahl der Top-k-Aufrufe von 1,671,253 Starts (5,761.8 ms) auf 2,329 Starts (941.8 ms). Das Update wählt außerdem automatisch den besten Top-k-Algorithmus anhand der Matrixform aus und passt die Schwellenwerte für Bitonic- und Radix-Verfahren an.

Warum es wichtig ist

Wer große Sprachmodelle auf Nvidia-GPUs ausführt, kann mit etwa sechsmal schnelleren Top-k-Operationen rechnen. Das beschleunigt Inferenz und Training.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.