Oossa

llama.cpp ускорила выбор top‑k на CUDA

Библиотека с открытым исходным кодом llama.cpp перешла на алгоритм radix select для top‑k на CUDA. В крупном тесте время выполнения сократилось с 5.76 s до 0.94 s.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Проект llama.cpp выпустил новую версию (b11513) 8 октября 2026 года. В ней прежняя процедура top‑k на CUDA, выполнявшаяся отдельно для каждой строки, заменена алгоритмом radix select с распределением строк по сетке. На модели Qwen‑4‑exp с последовательностью длиной 34,816 токенов число запусков top‑k сократилось с 1,671,253 (5,761.8 ms) до 2,329 (941.8 ms). Обновление также добавляет автоматический выбор наиболее подходящего алгоритма top‑k в зависимости от формы матрицы и уточняет пороговые значения для алгоритмов bitonic и radix.

Почему это важно

Разработчики, запускающие большие языковые модели на GPU Nvidia, могут рассчитывать примерно на шестикратное ускорение операций top‑k, что ускорит инференс и обучение.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.