Oossa

llama.cpp, CUDA top-k 선택 속도 개선

오픈소스 Llama.cpp 라이브러리가 CUDA top-k에 radix-select 알고리즘을 적용해 대규모 테스트에서 실행 시간을 5.76초에서 0.94초로 줄였습니다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

llama.cpp 프로젝트가 2026년 10월 8일 새 버전(b11513)을 출시했습니다. 이번 버전은 기존의 행별 CUDA top-k 루틴을 여러 행을 한꺼번에 처리하는 radix-select 방식으로 대체했습니다. Qwen-4-exp 모델에서 토큰 34,816개를 처리할 때 top-k 호출 횟수는 1,671,253회(5,761.8ms)에서 2,329회(941.8ms)로 줄었습니다. 행렬 형태에 따라 최적의 top-k 알고리즘을 자동으로 선택하는 기능도 추가했으며, bitonic 및 radix 방식의 적용 기준도 조정했습니다.

왜 중요한가

Nvidia GPU에서 대규모 언어 모델을 실행하는 개발자는 top-k 연산 속도가 약 6배 빨라져 추론과 학습을 더 빠르게 진행할 수 있습니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.