llama.cpp 프로젝트가 2026년 9월 30일 새 버전을 출시했다. 이번 버전은 최신 언어 모델 아키텍처인 GLM‑5.3‑Flash(또는 GLM5‑Next)를 지원한다. 컴퓨팅 버퍼 크기를 줄이고 긴 컨텍스트의 디코딩 속도를 높였으며, 토큰 처리와 GPU 메모리 관련 버그도 여러 건 수정했다. 이번 변경 사항은 CPU나 GPU에서 LLM을 로컬로 실행하는 개발자를 겨냥했다.
왜 중요한가
새 기능을 통해 사용자는 최신 GLM 모델을 자신의 하드웨어에서 더 빠르고 적은 메모리로 실행할 수 있다.