# LRCC, 저랭크 압축 LLM에 토큰별 연산 기능 추가

> 새 LRCC 방식은 Llama와 Qwen 모델이 토큰마다 효율적인 경로와 더 풍부한 경로를 선택하게 해, 추가 하드웨어 없이 정확도를 높인다.

Oossa · 2026-10-08 · https://oossa.com/ko/lrcc-adds-token-dependent-computation-to-low-rank-compressed-llms

연구진이 압축된 언어 모델의 성능을 높이는 방법인 저랭크 조건부 연산(LRCC)을 공개했다. 각 Transformer 블록에 작은 라우터를 추가해 현재 토큰에 따라 여러 저랭크 경로 중 하나를 고른다. 학습되는 부분은 라우터뿐이며 저랭크 행렬은 고정된 상태로 유지된다. Llama‑2‑7B, Llama‑3.2‑1B, Qwen을 대상으로 시험한 결과, LRCC는 정적 저랭크 압축 모델보다 Llama‑2‑7B의 다운스트림 정확도를 7.6%포인트 높였고, 디코딩 속도가 같을 때 퍼플렉서티도 개선했다.

## 팩트

- Llama‑2‑7B의 평균 다운스트림 정확도 7.6%포인트 상승
- 논문은 2026‑10‑08에 게시됐다

## 왜 중요한가

개발자는 연산 비용을 낮추면서도 정확도를 유지하는 토큰 적응형 모델을 실행할 수 있어, Llama나 Qwen을 사용하는 애플리케이션의 연산 비용을 줄일 수 있다.

## 출처 및 참고 자료

1. [LRCC: Generalizing Low-Rank Compression with Conditional Computation](https://arxiv.org/abs/2610.08858) – arXiv, 2026-10-08

최종 업데이트: 2026-10-08
