llama.cpp 프로젝트가 Vulkan 코드에서 32비트 부동소수점(F32)을 불러오는 방식을 바꾸는 패치를 공개했다. 인텔 GPU에서는 float를 하나씩 불러오는 것보다 두 개를 함께 불러오는 편이 빨라, 새 로직은 mul_mat_vec 루틴에서 2개 단위로 정렬된 로드를 사용한다. 누락됐던 정렬 확인도 추가했다. B60 테스트 보드에서 진행한 벤치마크 결과, 특정 행렬 크기에서 최대 1.63 TFLOPS를 기록해 이전 버전보다 눈에 띄게 성능이 향상됐다.
왜 중요한가
GPU 연산이 빨라지면 인텔 하드웨어에서 llama.cpp를 사용하는 사람들의 LLM 추론 속도도 빨라진다.