Oossa

llama.cpp, Vulkan 중복 행 최적화 추가

오픈소스 LLaMA 추론 라이브러리가 GPU에서 행이 반복될 때 불필요한 연산을 건너뛰어 Vulkan 기기의 속도를 높입니다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

llama.cpp 프로젝트는 2026‑10‑11에 버전 b11554를 출시했습니다. 이번 업데이트에는 행렬 곱셈에서 중복된 행 ID를 감지해 반복 처리하는 대신 사전 단계에서 처리하는 Vulkan 전용 수정 사항이 포함됐습니다. ‘hoist row ids’ 최적화도 개선해 항상 실행되도록 하고, 여러 개의 압축 타일을 출력할 수 있게 했습니다. 이에 따라 GPU는 작업 그룹을 더 적게 실행하고, 가능한 경우 더 일찍 종료할 수 있습니다.

왜 중요한가

llama.cpp를 GPU에서 사용하는 경우 같은 계산을 반복하지 않게 돼 추론 속도가 빨라질 수 있습니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.