ggml‑org/llama.cpp 라이브러리가 2026년 10월 7일 버전 b11475를 출시했습니다. 이번 버전은 Metal(Apple GPU) 백엔드에서 융합된 MUL_MAT+ADD 연산이 잘못된 잔차 행렬을 선택하던 버그를 수정합니다. 한 단계에서 여러 행렬 곱셈을 사용하는 모델의 결과가 부정확해지는 문제였습니다. 수정 사항은 인코더가 올바른 피연산자를 선택하도록 해 Metal GPU에서 정확한 출력을 복구합니다.
왜 중요한가
Apple GPU에서 llama.cpp를 사용하는 개발자는 이전처럼 확률값이 일률적으로 나오는 대신 신뢰할 수 있는 모델 출력을 얻을 수 있습니다.