# llama.cpp snabbar upp CUDA-beräkningar för top‑k

> Biblioteket Llama.cpp med öppen källkod använder nu en radix‑select-algoritm för CUDA top‑k. I ett stort test sjönk körtiden från 5.76 s till 0.94 s.

Oossa · 2026-10-08 · https://oossa.com/sv/llama-cpp-adds-faster-cuda-top-k-selection

Projektet llama.cpp släppte en ny version (b11513) den Oct 8 2026. Den ersätter den tidigare CUDA top‑k-rutinen, som kördes separat för varje rad, med radix select över ett rutnät av rader. För modellen Qwen‑4‑exp vid 34,816 tokens minskar ändringen antalet top‑k-anrop från 1,671,253 körningar (5,761.8 ms) till 2,329 körningar (941.8 ms). Uppdateringen väljer också automatiskt den bästa top‑k-algoritmen utifrån matrisens form och finjusterar tröskelvärdena för bitonic- och radix-metoderna.

## Fakta

- Utgivningsdatum: Oct 8 2026 – "PUBLISHED: Thu Oct 08 2026"
- Körtiden för Qwen‑4‑exp minskar från 5,761.8 ms till 941.8 ms

## Varför det spelar roll

Utvecklare som kör stora språkmodeller på Nvidia-grafikkort kan räkna med ungefär sex gånger snabbare top‑k-operationer, vilket snabbar upp inferens och träning.

## Källor och referenser

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Senast uppdaterad: 2026-10-08
