Projektet llama.cpp släppte en ny version (b11513) den Oct 8 2026. Den ersätter den tidigare CUDA top‑k-rutinen, som kördes separat för varje rad, med radix select över ett rutnät av rader. För modellen Qwen‑4‑exp vid 34,816 tokens minskar ändringen antalet top‑k-anrop från 1,671,253 körningar (5,761.8 ms) till 2,329 körningar (941.8 ms). Uppdateringen väljer också automatiskt den bästa top‑k-algoritmen utifrån matrisens form och finjusterar tröskelvärdena för bitonic- och radix-metoderna.
Varför det spelar roll
Utvecklare som kör stora språkmodeller på Nvidia-grafikkort kan räkna med ungefär sex gånger snabbare top‑k-operationer, vilket snabbar upp inferens och träning.