Oossa

llama.cpp acelera a seleção top‑k em CUDA

A biblioteca de código aberto Llama.cpp passou a usar um algoritmo radix select para top‑k em CUDA, reduzindo o tempo de execução de 5.76 s para 0.94 s em um teste de grande porte.

NotaPor Publicado pelo Oossa: 1 min de leitura

O projeto llama.cpp lançou uma nova versão (b11513) em Oct 8 2026. Ela substitui a rotina CUDA top‑k anterior, que processava cada linha separadamente, por um algoritmo radix select que distribui o trabalho entre as linhas. No modelo Qwen‑4‑exp, com 34,816 tokens, a mudança reduz as chamadas top‑k de 1,671,253 lançamentos (5,761.8 ms) para 2,329 lançamentos (941.8 ms). A atualização também seleciona automaticamente o melhor algoritmo top‑k de acordo com o formato da matriz e ajusta os limites dos métodos bitonic e radix.

Por que importa

Desenvolvedores que executam grandes modelos de linguagem em GPUs Nvidia podem esperar operações top‑k cerca de seis vezes mais rápidas, acelerando a inferência e o treinamento.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.