O projeto llama.cpp lançou uma nova versão (b11513) em Oct 8 2026. Ela substitui a rotina CUDA top‑k anterior, que processava cada linha separadamente, por um algoritmo radix select que distribui o trabalho entre as linhas. No modelo Qwen‑4‑exp, com 34,816 tokens, a mudança reduz as chamadas top‑k de 1,671,253 lançamentos (5,761.8 ms) para 2,329 lançamentos (941.8 ms). A atualização também seleciona automaticamente o melhor algoritmo top‑k de acordo com o formato da matriz e ajusta os limites dos métodos bitonic e radix.
Por que importa
Desenvolvedores que executam grandes modelos de linguagem em GPUs Nvidia podem esperar operações top‑k cerca de seis vezes mais rápidas, acelerando a inferência e o treinamento.