llama.cpp 프로젝트는 2026‑10‑11에 버전 b11554를 출시했습니다. 이번 업데이트에는 행렬 곱셈에서 중복된 행 ID를 감지해 반복 처리하는 대신 사전 단계에서 처리하는 Vulkan 전용 수정 사항이 포함됐습니다. ‘hoist row ids’ 최적화도 개선해 항상 실행되도록 하고, 여러 개의 압축 타일을 출력할 수 있게 했습니다. 이에 따라 GPU는 작업 그룹을 더 적게 실행하고, 가능한 경우 더 일찍 종료할 수 있습니다.
왜 중요한가
llama.cpp를 GPU에서 사용하는 경우 같은 계산을 반복하지 않게 돼 추론 속도가 빨라질 수 있습니다.