El proyecto llama.cpp publicó una nueva versión (b11513) el Oct 8 2026. Esta sustituye la rutina anterior de top‑k en CUDA, que procesaba cada fila por separado, por un algoritmo radix select que distribuye el trabajo entre filas. En el modelo Qwen‑4‑exp, con 34,816 tokens, el cambio reduce las llamadas a top‑k de 1,671,253 lanzamientos (5,761.8 ms) a 2,329 (941.8 ms). La actualización también añade la selección automática del mejor algoritmo top‑k según la forma de la matriz y ajusta los umbrales para las rutas bitonic y radix.
Por qué importa
Los desarrolladores que ejecutan modelos de lenguaje grandes en GPU Nvidia pueden esperar operaciones top‑k aproximadamente seis veces más rápidas, lo que acelera la inferencia y el entrenamiento.