Oossa

llama.cpp, GLM5‑Next 다중 토큰 예측과 속도 개선 추가

오픈소스 LLM 실행 도구가 새 GLM5‑Next MTP 헤드를 지원해 4토큰 보정 지연 시간을 0.33 ms로 줄였다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

llama.cpp 프로젝트가 2026‑10‑07 버전 b11474를 공개했다. 이번 버전은 모델 실행기에 NextN이라는 GLM5‑Next 다중 토큰 예측(MTP) 그래프를 추가했다. 출력 행이 필요하지 않을 때 불필요한 연산을 건너뛰도록 해 4토큰 보정 지연 시간을 6.9 ms에서 0.33 ms로 줄였다. 또 추출 계약 문제를 수정하고 부분적인 순환 롤백 처리도 개선했다.

왜 중요한가

개발자는 이제 llama.cpp 모델을 더 빠르게 실행할 수 있다. 특히 다중 토큰 예측에 의존하는 초안 기반 생성에서 속도 향상을 기대할 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.