# KV 캐시 크기 최대 25배 줄이는 셀프 프루닝 트랜스포머

> 연구진이 영향이 적은 토큰을 학습을 통해 자동으로 제거하는 ‘유니버설 어텐션’을 공개했다. 일반적인 작업에서는 10배, 1만 6,000토큰 시퀀스에서는 25배 압축을 달성했다.

Oossa · 2026-10-08 · https://oossa.com/ko/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Ahan Gupta가 이끄는 연구팀은 ‘유니버설 어텐션’이라는 새로운 아키텍처를 발표했다. 이 방식은 표준 RoPE 위치 임베딩과 Softmax 어텐션을 유지하면서, 추론 과정에서 어떤 토큰을 제거할지 결정하는 학습 가능한 감쇠 메커니즘을 추가한다. 대규모 언어 모델이 사용하는 메모리인 키-값 캐시를 정확도 저하 없이 줄인다. 테스트 결과, 일반적인 데이터에서는 캐시 크기를 10분의 1로, 16,000토큰 입력을 처리할 때는 25분의 1로 줄였으며, 다운스트림 성능도 향상됐다.

## 팩트

- 자연어 작업에서 KV 캐시 10배 압축
- 16k 토큰 길이에서 25배 압축

## 왜 중요한가

캐시에 필요한 메모리가 줄면 메모리가 제한된 기기에서 대규모 언어 모델을 더 저렴하고 빠르게 배포할 수 있다.

## 출처 및 참고 자료

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

최종 업데이트: 2026-10-08
