llama.cpp 프로젝트가 2026년 10월 8일 새 버전(b11513)을 출시했습니다. 이번 버전은 기존의 행별 CUDA top-k 루틴을 여러 행을 한꺼번에 처리하는 radix-select 방식으로 대체했습니다. Qwen-4-exp 모델에서 토큰 34,816개를 처리할 때 top-k 호출 횟수는 1,671,253회(5,761.8ms)에서 2,329회(941.8ms)로 줄었습니다. 행렬 형태에 따라 최적의 top-k 알고리즘을 자동으로 선택하는 기능도 추가했으며, bitonic 및 radix 방식의 적용 기준도 조정했습니다.
왜 중요한가
Nvidia GPU에서 대규모 언어 모델을 실행하는 개발자는 top-k 연산 속도가 약 6배 빨라져 추론과 학습을 더 빠르게 진행할 수 있습니다.