오픈소스 프로젝트 llama.cpp가 2026년 10월 11일 버전 b11558을 공개했습니다. 이번 업데이트에서는 Q4_K 양자화 가중치를 사용할 때 OpenCL 커널이 기기의 이미지 한도를 초과하던 버그를 수정했습니다. 해당 한도에 걸리는 기기에서 사용할 대체 경로도 추가했으며, Q4_0 커널의 브로드캐스팅과 RMS 정규화 계산도 바로잡았습니다. 이번 변경은 Qualcomm의 Hongqiang Wang과 공동으로 작성했습니다.
왜 중요한가
llama.cpp를 GPU에서 사용하는 개발자는 이제 더 다양한 하드웨어에서 충돌 없이 Q4_K 양자화 모델을 실행할 수 있습니다.