Oossa

APEX, Qwen3-8B 디코딩 속도 최대 5.2배 높여

새 APEX 컨트롤러는 Qwen3-8B 모델의 추론 시간을 최대 5.24배 단축하고, 낭비되는 초안 토큰을 41% 줄인다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

연구진은 생성할 초안 토큰 수와 사용할 추측 디코딩 방식을 선택하는 학습 기반 컨트롤러 APEX를 선보였다. APEX는 vLLM 추론 엔진에 통합되며, Qwen3-8B 언어 모델에서 테스트됐다. 6개 벤치마크 작업에서 APEX는 표준 자기회귀 디코딩보다 최대 5.24배 빠른 속도를 기록했다. APEX‑Depth 변형은 고정된 크기 16의 n‑그램 초안 방식보다 낭비되는 토큰을 41% 줄이면서도 3.27배의 속도 향상을 유지했다.

왜 중요한가

개발자는 대규모 언어 모델을 더 빠르고 저렴하게 실행할 수 있어, 실시간 AI 기능의 비용 부담을 낮출 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.