llama.cpp 프로젝트가 2026‑10‑07 버전 b11474를 공개했다. 이번 버전은 모델 실행기에 NextN이라는 GLM5‑Next 다중 토큰 예측(MTP) 그래프를 추가했다. 출력 행이 필요하지 않을 때 불필요한 연산을 건너뛰도록 해 4토큰 보정 지연 시간을 6.9 ms에서 0.33 ms로 줄였다. 또 추출 계약 문제를 수정하고 부분적인 순환 롤백 처리도 개선했다.
왜 중요한가
개발자는 이제 llama.cpp 모델을 더 빠르게 실행할 수 있다. 특히 다중 토큰 예측에 의존하는 초안 기반 생성에서 속도 향상을 기대할 수 있다.