# llama.cpp, CUDA top-k 선택 속도 개선

> 오픈소스 Llama.cpp 라이브러리가 CUDA top-k에 radix-select 알고리즘을 적용해 대규모 테스트에서 실행 시간을 5.76초에서 0.94초로 줄였습니다.

Oossa · 2026-10-08 · https://oossa.com/ko/llama-cpp-adds-faster-cuda-top-k-selection

llama.cpp 프로젝트가 2026년 10월 8일 새 버전(b11513)을 출시했습니다. 이번 버전은 기존의 행별 CUDA top-k 루틴을 여러 행을 한꺼번에 처리하는 radix-select 방식으로 대체했습니다. Qwen-4-exp 모델에서 토큰 34,816개를 처리할 때 top-k 호출 횟수는 1,671,253회(5,761.8ms)에서 2,329회(941.8ms)로 줄었습니다. 행렬 형태에 따라 최적의 top-k 알고리즘을 자동으로 선택하는 기능도 추가했으며, bitonic 및 radix 방식의 적용 기준도 조정했습니다.

## 팩트

- 출시일: 2026년 10월 8일 – "PUBLISHED: Thu Oct 08 2026"
- Qwen-4-exp 실행 시간: 5,761.8ms에서 941.8ms로 단축

## 왜 중요한가

Nvidia GPU에서 대규모 언어 모델을 실행하는 개발자는 top-k 연산 속도가 약 6배 빨라져 추론과 학습을 더 빠르게 진행할 수 있습니다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

최종 업데이트: 2026-10-08
