# llama.cpp, GLM5‑Next 다중 토큰 예측과 속도 개선 추가

> 오픈소스 LLM 실행 도구가 새 GLM5‑Next MTP 헤드를 지원해 4토큰 보정 지연 시간을 0.33 ms로 줄였다.

Oossa · 2026-10-07 · https://oossa.com/ko/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

llama.cpp 프로젝트가 2026‑10‑07 버전 b11474를 공개했다. 이번 버전은 모델 실행기에 NextN이라는 GLM5‑Next 다중 토큰 예측(MTP) 그래프를 추가했다. 출력 행이 필요하지 않을 때 불필요한 연산을 건너뛰도록 해 4토큰 보정 지연 시간을 6.9 ms에서 0.33 ms로 줄였다. 또 추출 계약 문제를 수정하고 부분적인 순환 롤백 처리도 개선했다.

## 팩트

- 버전 b11474가 2026‑10‑07(“Wed Oct 07 2026 15:42:20 GMT+0200”)에 공개됐다
- 4토큰 보정 지연 시간이 6.9 ms에서 0.33 ms로 줄었다

## 왜 중요한가

개발자는 이제 llama.cpp 모델을 더 빠르게 실행할 수 있다. 특히 다중 토큰 예측에 의존하는 초안 기반 생성에서 속도 향상을 기대할 수 있다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

최종 업데이트: 2026-10-07
