Oossa

llama.cpp acelera la selección top‑k en CUDA

La biblioteca de código abierto llama.cpp incorpora un algoritmo radix-select para top‑k en CUDA, que reduce el tiempo de ejecución de 5.76 s a 0.94 s en una prueba de gran tamaño.

BrevePor Publicado por Oossa: 1 min de lectura

El proyecto llama.cpp publicó una nueva versión (b11513) el Oct 8 2026. Esta sustituye la rutina anterior de top‑k en CUDA, que procesaba cada fila por separado, por un algoritmo radix select que distribuye el trabajo entre filas. En el modelo Qwen‑4‑exp, con 34,816 tokens, el cambio reduce las llamadas a top‑k de 1,671,253 lanzamientos (5,761.8 ms) a 2,329 (941.8 ms). La actualización también añade la selección automática del mejor algoritmo top‑k según la forma de la matriz y ajusta los umbrales para las rutas bitonic y radix.

Por qué importa

Los desarrolladores que ejecutan modelos de lenguaje grandes en GPU Nvidia pueden esperar operaciones top‑k aproximadamente seis veces más rápidas, lo que acelera la inferencia y el entrenamiento.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.