ggml‑org 팀이 llama.cpp 버전 b11489를 공개했습니다. 릴리스 노트에 따르면 이번 업데이트는 압축된 모델 가중치를 다시 사용할 수 있는 숫자로 변환하는 단계인 Q6_K 가중치 역양자화 속도를 높이고, 언롤링 배수를 두 배로 늘렸습니다. Apple Silicon, Intel macOS, iOS와 Vulkan 및 CUDA 빌드를 포함한 여러 Ubuntu 구성용 사전 빌드 바이너리도 제공됩니다.
왜 중요한가
역양자화가 빨라지면 같은 하드웨어에서 LLM을 더 낮은 지연 시간으로 실행할 수 있습니다.