Ahan Gupta가 이끄는 연구팀은 ‘유니버설 어텐션’이라는 새로운 아키텍처를 발표했다. 이 방식은 표준 RoPE 위치 임베딩과 Softmax 어텐션을 유지하면서, 추론 과정에서 어떤 토큰을 제거할지 결정하는 학습 가능한 감쇠 메커니즘을 추가한다. 대규모 언어 모델이 사용하는 메모리인 키-값 캐시를 정확도 저하 없이 줄인다. 테스트 결과, 일반적인 데이터에서는 캐시 크기를 10분의 1로, 16,000토큰 입력을 처리할 때는 25분의 1로 줄였으며, 다운스트림 성능도 향상됐다.
왜 중요한가
캐시에 필요한 메모리가 줄면 메모리가 제한된 기기에서 대규모 언어 모델을 더 저렴하고 빠르게 배포할 수 있다.