llama.cpp 라이브러리가 2026년 10월 3일 새 버전(b11374)을 출시했다. 이번 버전은 OpenVINO 백엔드를 2026.4.1로 업데이트하고 새로운 conv-fusion을 추가했다. GPU 버퍼 오류를 수정하고 혼합 전문가(MoE) 모델의 축 처리도 바로잡았다. 이에 따라 MoE 퓨전 모델의 토큰 생성 속도가 빨라지고 일부 Intel GPU에서 발생하던 충돌이 방지된다.
왜 중요한가
Intel GPU에서 llama.cpp를 사용하는 개발자는 이제 OpenVINO를 더 빠르고 안정적으로 이용할 수 있다.