연구진이 압축된 언어 모델의 성능을 높이는 방법인 저랭크 조건부 연산(LRCC)을 공개했다. 각 Transformer 블록에 작은 라우터를 추가해 현재 토큰에 따라 여러 저랭크 경로 중 하나를 고른다. 학습되는 부분은 라우터뿐이며 저랭크 행렬은 고정된 상태로 유지된다. Llama‑2‑7B, Llama‑3.2‑1B, Qwen을 대상으로 시험한 결과, LRCC는 정적 저랭크 압축 모델보다 Llama‑2‑7B의 다운스트림 정확도를 7.6%포인트 높였고, 디코딩 속도가 같을 때 퍼플렉서티도 개선했다.
왜 중요한가
개발자는 연산 비용을 낮추면서도 정확도를 유지하는 토큰 적응형 모델을 실행할 수 있어, Llama나 Qwen을 사용하는 애플리케이션의 연산 비용을 줄일 수 있다.