# llama.cpp versnelt CUDA-top-k-selectie

> De open-sourcelibrary Llama.cpp gebruikt nu een radix-selectiealgoritme voor CUDA-top-k. Bij een grote test daalde de looptijd van 5.76 s naar 0.94 s.

Oossa · 2026-10-08 · https://oossa.com/nl/llama-cpp-adds-faster-cuda-top-k-selection

Het llama.cpp-project bracht op Oct 8 2026 een nieuwe versie uit (b11513). Die vervangt de eerdere CUDA-top-k-routine per rij door radix-selectie over een grid van rijen. Bij het model Qwen‑4‑exp met 34,816 tokens daalt het aantal top-k-aanroepen van 1,671,253 launches (5,761.8 ms) naar 2,329 launches (941.8 ms). De update kiest ook automatisch het beste top-k-algoritme op basis van de matrixvorm en verfijnt de drempelwaarden voor bitonic- en radix-routes.

## De feiten

- Releasedatum: Oct 8 2026 – "PUBLISHED: Thu Oct 08 2026"
- Looptijd bij Qwen‑4‑exp: van 5,761.8 ms naar 941.8 ms

## Waarom het ertoe doet

Ontwikkelaars die grote taalmodellen op Nvidia-GPU’s draaien, kunnen rekenen op top-k-bewerkingen die ongeveer zes keer zo snel zijn. Dat versnelt inferentie en training.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Laatst bijgewerkt: 2026-10-08
