# llama.cpp, Vulkan 중복 행 최적화 추가

> 오픈소스 LLaMA 추론 라이브러리가 GPU에서 행이 반복될 때 불필요한 연산을 건너뛰어 Vulkan 기기의 속도를 높입니다.

Oossa · 2026-10-11 · https://oossa.com/ko/llama-cpp-adds-vulkan-duplicate-row-optimizations

llama.cpp 프로젝트는 2026‑10‑11에 버전 b11554를 출시했습니다. 이번 업데이트에는 행렬 곱셈에서 중복된 행 ID를 감지해 반복 처리하는 대신 사전 단계에서 처리하는 Vulkan 전용 수정 사항이 포함됐습니다. ‘hoist row ids’ 최적화도 개선해 항상 실행되도록 하고, 여러 개의 압축 타일을 출력할 수 있게 했습니다. 이에 따라 GPU는 작업 그룹을 더 적게 실행하고, 가능한 경우 더 일찍 종료할 수 있습니다.

## 팩트

- 버전 b11554는 2026년 10월 11일 일요일에 공개됨
- llama.cpp에 Vulkan 중복 행 처리 기능 추가

## 왜 중요한가

llama.cpp를 GPU에서 사용하는 경우 같은 계산을 반복하지 않게 돼 추론 속도가 빨라질 수 있습니다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

최종 업데이트: 2026-10-11
