# llama.cpp acelera la selección top‑k en CUDA

> La biblioteca de código abierto llama.cpp incorpora un algoritmo radix-select para top‑k en CUDA, que reduce el tiempo de ejecución de 5.76 s a 0.94 s en una prueba de gran tamaño.

Oossa · 2026-10-08 · https://oossa.com/es/llama-cpp-adds-faster-cuda-top-k-selection

El proyecto llama.cpp publicó una nueva versión (b11513) el Oct 8 2026. Esta sustituye la rutina anterior de top‑k en CUDA, que procesaba cada fila por separado, por un algoritmo radix select que distribuye el trabajo entre filas. En el modelo Qwen‑4‑exp, con 34,816 tokens, el cambio reduce las llamadas a top‑k de 1,671,253 lanzamientos (5,761.8 ms) a 2,329 (941.8 ms). La actualización también añade la selección automática del mejor algoritmo top‑k según la forma de la matriz y ajusta los umbrales para las rutas bitonic y radix.

## Los hechos

- Fecha de lanzamiento: Oct 8 2026 – "PUBLISHED: Thu Oct 08 2026"
- Reducción del tiempo de ejecución en Qwen‑4‑exp: de 5,761.8 ms a 941.8 ms

## Por qué importa

Los desarrolladores que ejecutan modelos de lenguaje grandes en GPU Nvidia pueden esperar operaciones top‑k aproximadamente seis veces más rápidas, lo que acelera la inferencia y el entrenamiento.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Última actualización: 2026-10-08
