Het llama.cpp-project bracht op Oct 8 2026 een nieuwe versie uit (b11513). Die vervangt de eerdere CUDA-top-k-routine per rij door radix-selectie over een grid van rijen. Bij het model Qwen‑4‑exp met 34,816 tokens daalt het aantal top-k-aanroepen van 1,671,253 launches (5,761.8 ms) naar 2,329 launches (941.8 ms). De update kiest ook automatisch het beste top-k-algoritme op basis van de matrixvorm en verfijnt de drempelwaarden voor bitonic- en radix-routes.
Waarom het ertoe doet
Ontwikkelaars die grote taalmodellen op Nvidia-GPU’s draaien, kunnen rekenen op top-k-bewerkingen die ongeveer zes keer zo snel zijn. Dat versnelt inferentie en training.