Oossa

KV 캐시 크기 최대 25배 줄이는 셀프 프루닝 트랜스포머

연구진이 영향이 적은 토큰을 학습을 통해 자동으로 제거하는 ‘유니버설 어텐션’을 공개했다. 일반적인 작업에서는 10배, 1만 6,000토큰 시퀀스에서는 25배 압축을 달성했다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Ahan Gupta가 이끄는 연구팀은 ‘유니버설 어텐션’이라는 새로운 아키텍처를 발표했다. 이 방식은 표준 RoPE 위치 임베딩과 Softmax 어텐션을 유지하면서, 추론 과정에서 어떤 토큰을 제거할지 결정하는 학습 가능한 감쇠 메커니즘을 추가한다. 대규모 언어 모델이 사용하는 메모리인 키-값 캐시를 정확도 저하 없이 줄인다. 테스트 결과, 일반적인 데이터에서는 캐시 크기를 10분의 1로, 16,000토큰 입력을 처리할 때는 25분의 1로 줄였으며, 다운스트림 성능도 향상됐다.

왜 중요한가

캐시에 필요한 메모리가 줄면 메모리가 제한된 기기에서 대규모 언어 모델을 더 저렴하고 빠르게 배포할 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.