# llama.cpp acelera a seleção top‑k em CUDA

> A biblioteca de código aberto Llama.cpp passou a usar um algoritmo radix select para top‑k em CUDA, reduzindo o tempo de execução de 5.76 s para 0.94 s em um teste de grande porte.

Oossa · 2026-10-08 · https://oossa.com/pt/llama-cpp-adds-faster-cuda-top-k-selection

O projeto llama.cpp lançou uma nova versão (b11513) em Oct 8 2026. Ela substitui a rotina CUDA top‑k anterior, que processava cada linha separadamente, por um algoritmo radix select que distribui o trabalho entre as linhas. No modelo Qwen‑4‑exp, com 34,816 tokens, a mudança reduz as chamadas top‑k de 1,671,253 lançamentos (5,761.8 ms) para 2,329 lançamentos (941.8 ms). A atualização também seleciona automaticamente o melhor algoritmo top‑k de acordo com o formato da matriz e ajusta os limites dos métodos bitonic e radix.

## Os fatos

- Data de lançamento: Oct 8 2026 – "PUBLISHED: Thu Oct 08 2026"
- Redução do tempo de execução no Qwen‑4‑exp: de 5,761.8 ms para 941.8 ms

## Por que importa

Desenvolvedores que executam grandes modelos de linguagem em GPUs Nvidia podem esperar operações top‑k cerca de seis vezes mais rápidas, acelerando a inferência e o treinamento.

## Fontes e referências

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Última atualização: 2026-10-08
