ggml-org 팀이 2026년 9월 29일 llama.cpp 버전 b11262를 공개했습니다. 이번 업데이트에는 반정밀도(f16) 내적을 계산하고 단정밀도(f32)로 누적해 정확도를 높이는 AVX512-FP16 지원이 추가됐습니다. AVX512-FP16 명령어 세트를 지원하는 CPU에서 추론 속도를 높이는 저수준 변경입니다. 이번 릴리스에는 macOS, iOS 및 여러 Linux 빌드용 새 바이너리도 포함됐습니다.
왜 중요한가
수치 정확도를 유지하면서 최신 CPU에서 LLM을 더 빠르게 실행할 수 있어 개발자에게 유용합니다.