Oossa

llama.cpp versnelt CUDA-top-k-selectie

De open-sourcelibrary Llama.cpp gebruikt nu een radix-selectiealgoritme voor CUDA-top-k. Bij een grote test daalde de looptijd van 5.76 s naar 0.94 s.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het llama.cpp-project bracht op Oct 8 2026 een nieuwe versie uit (b11513). Die vervangt de eerdere CUDA-top-k-routine per rij door radix-selectie over een grid van rijen. Bij het model Qwen‑4‑exp met 34,816 tokens daalt het aantal top-k-aanroepen van 1,671,253 launches (5,761.8 ms) naar 2,329 launches (941.8 ms). De update kiest ook automatisch het beste top-k-algoritme op basis van de matrixvorm en verfijnt de drempelwaarden voor bitonic- en radix-routes.

Waarom het ertoe doet

Ontwikkelaars die grote taalmodellen op Nvidia-GPU’s draaien, kunnen rekenen op top-k-bewerkingen die ongeveer zes keer zo snel zijn. Dat versnelt inferentie en training.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.