ggml‑org가 llama.cpp 버전 b11555를 출시했다. 이번 업데이트에서는 F16C 명령어 세트를 지원하는 AVX2 CPU에서도 이를 사용하지 않던 버그를 수정했다. macOS Apple Silicon과 macOS Intel, iOS용 바이너리 패키지와 Vulkan 및 CUDA 12.8을 지원하는 구성을 포함한 여러 Ubuntu용 패키지도 새로 제공한다.
왜 중요한가
호환되는 CPU에서 Llama 모델을 실행하는 개발자는 수동으로 패치를 적용하지 않아도 추론 속도를 높일 수 있다.