Oossa

llama.cpp snabbar upp CUDA-beräkningar för top‑k

Biblioteket Llama.cpp med öppen källkod använder nu en radix‑select-algoritm för CUDA top‑k. I ett stort test sjönk körtiden från 5.76 s till 0.94 s.

NotisAv Publicerad av Oossa: 1 min läsning

Projektet llama.cpp släppte en ny version (b11513) den Oct 8 2026. Den ersätter den tidigare CUDA top‑k-rutinen, som kördes separat för varje rad, med radix select över ett rutnät av rader. För modellen Qwen‑4‑exp vid 34,816 tokens minskar ändringen antalet top‑k-anrop från 1,671,253 körningar (5,761.8 ms) till 2,329 körningar (941.8 ms). Uppdateringen väljer också automatiskt den bästa top‑k-algoritmen utifrån matrisens form och finjusterar tröskelvärdena för bitonic- och radix-metoderna.

Varför det spelar roll

Utvecklare som kör stora språkmodeller på Nvidia-grafikkort kan räkna med ungefär sex gånger snabbare top‑k-operationer, vilket snabbar upp inferens och träning.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.