# llama.cpp beschleunigt CUDA-Top-k-Auswahl

> Die Open-Source-Bibliothek Llama.cpp nutzt für CUDA-Top-k jetzt einen Radix-Select-Algorithmus. In einem großen Test sinkt die Laufzeit von 5.76 s auf 0.94 s.

Oossa · 2026-10-08 · https://oossa.com/de/llama-cpp-adds-faster-cuda-top-k-selection

Das llama.cpp-Projekt hat am 8. Oktober 2026 eine neue Version (b11513) veröffentlicht. Sie ersetzt das bisherige zeilenweise CUDA-Top-k-Verfahren durch eine Radix-Auswahl, die zeilenweise über ein Grid ausgeführt wird. Beim Modell Qwen‑4‑exp mit 34,816 Tokens sinkt dadurch die Zahl der Top-k-Aufrufe von 1,671,253 Starts (5,761.8 ms) auf 2,329 Starts (941.8 ms). Das Update wählt außerdem automatisch den besten Top-k-Algorithmus anhand der Matrixform aus und passt die Schwellenwerte für Bitonic- und Radix-Verfahren an.

## Die Fakten

- Veröffentlichungsdatum: 8. Oktober 2026 – „PUBLISHED: Thu Oct 08 2026“
- Laufzeit beim Modell Qwen‑4‑exp: von 5,761.8 ms auf 941.8 ms

## Warum es wichtig ist

Wer große Sprachmodelle auf Nvidia-GPUs ausführt, kann mit etwa sechsmal schnelleren Top-k-Operationen rechnen. Das beschleunigt Inferenz und Training.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
