# llama.cpp ускорила выбор top‑k на CUDA

> Библиотека с открытым исходным кодом llama.cpp перешла на алгоритм radix select для top‑k на CUDA. В крупном тесте время выполнения сократилось с 5.76 s до 0.94 s.

Oossa · 2026-10-08 · https://oossa.com/ru/llama-cpp-adds-faster-cuda-top-k-selection

Проект llama.cpp выпустил новую версию (b11513) 8 октября 2026 года. В ней прежняя процедура top‑k на CUDA, выполнявшаяся отдельно для каждой строки, заменена алгоритмом radix select с распределением строк по сетке. На модели Qwen‑4‑exp с последовательностью длиной 34,816 токенов число запусков top‑k сократилось с 1,671,253 (5,761.8 ms) до 2,329 (941.8 ms). Обновление также добавляет автоматический выбор наиболее подходящего алгоритма top‑k в зависимости от формы матрицы и уточняет пороговые значения для алгоритмов bitonic и radix.

## Факты

- Дата выпуска: 8 октября 2026 года — «PUBLISHED: Thu Oct 08 2026»
- Сокращение времени выполнения на Qwen‑4‑exp: с 5,761.8 ms до 941.8 ms

## Почему это важно

Разработчики, запускающие большие языковые модели на GPU Nvidia, могут рассчитывать примерно на шестикратное ускорение операций top‑k, что ускорит инференс и обучение.

## Источники и ссылки

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

Обновлено: 2026-10-08
