ggml-org 팀이 llama.cpp 버전 b11398을 출시했습니다. 이번 버전은 x86 플랫폼의 tinyBLAS CPU 백엔드에서 BF16, FP16, FP32 잔여 데이터를 처리하도록 지원합니다. 계산 속도를 높이기 위해 이러한 잔여 데이터 처리도 벡터화했습니다. macOS(Apple Silicon 및 Intel), iOS, 여러 Ubuntu 아키텍처용 사전 빌드 바이너리도 제공됩니다. 이번 업데이트에는 참조 구현을 사용할 때 정확하게 비교할 수 있도록 테스트를 조정한 내용도 포함됐습니다.
왜 중요한가
개발자는 GPU 가속 없이 일반 CPU에서 LLM 추론을 더 빠르게 실행할 수 있습니다.