Oossa

llama.cpp v0.1.11534, CUDA 복사 최적화 추가

오픈소스 LLaMA 추론 라이브러리가 불필요한 GPU 메모리 복사를 줄여 특정 작업의 오버헤드를 낮췄다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

ggml-org 팀은 2026-10-09에 llama.cpp 버전 b11534를 공개했다. 이번 업데이트는 상태 스냅샷 복사를 순환 캐시에 통합하고, K = 1인 비투기적 디코딩 사례에서 불필요한 CUDA 복사를 없앴다. 변경 사항은 CUDA 백엔드에만 적용되므로 CPU 및 Vulkan 빌드에는 영향을 주지 않는다. macOS, iOS와 여러 Ubuntu 버전용 사전 빌드 바이너리를 다운로드할 수 있다.

CUDA 버전을 사용하는 경우 GPU 메모리 트래픽이 소폭 줄어들어, 지원되는 하드웨어에서 속도가 향상될 수 있다.

왜 중요한가

GPU에서 이동하는 데이터가 줄어 CUDA 사용자의 추론 속도가 향상될 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.