연구진은 생성할 초안 토큰 수와 사용할 추측 디코딩 방식을 선택하는 학습 기반 컨트롤러 APEX를 선보였다. APEX는 vLLM 추론 엔진에 통합되며, Qwen3-8B 언어 모델에서 테스트됐다. 6개 벤치마크 작업에서 APEX는 표준 자기회귀 디코딩보다 최대 5.24배 빠른 속도를 기록했다. APEX‑Depth 변형은 고정된 크기 16의 n‑그램 초안 방식보다 낭비되는 토큰을 41% 줄이면서도 3.27배의 속도 향상을 유지했다.
왜 중요한가
개발자는 대규모 언어 모델을 더 빠르고 저렴하게 실행할 수 있어, 실시간 AI 기능의 비용 부담을 낮출 수 있다.