Проект llama.cpp выпустил новую версию (b11513) 8 октября 2026 года. В ней прежняя процедура top‑k на CUDA, выполнявшаяся отдельно для каждой строки, заменена алгоритмом radix select с распределением строк по сетке. На модели Qwen‑4‑exp с последовательностью длиной 34,816 токенов число запусков top‑k сократилось с 1,671,253 (5,761.8 ms) до 2,329 (941.8 ms). Обновление также добавляет автоматический выбор наиболее подходящего алгоритма top‑k в зависимости от формы матрицы и уточняет пороговые значения для алгоритмов bitonic и radix.
Почему это важно
Разработчики, запускающие большие языковые модели на GPU Nvidia, могут рассчитывать примерно на шестикратное ускорение операций top‑k, что ускорит инференс и обучение.