# 自剪枝 Transformer 将 KV 缓存缩小至原来的 1/25

> 研究人员推出 Universal Attention：一种可训练方法，能自适应地移除影响较小的 token。在常见任务中可将缓存压缩 10 倍，处理 16k token 序列时可压缩 25 倍。

Oossa · 2026-10-08 · https://oossa.com/zh/self-pruning-transformer-cuts-kv-cache-size-up-to-25

由 Ahan Gupta 领导的团队推出了一种名为 Universal Attention 的新架构。它保留了标准的 RoPE 位置嵌入和 Softmax 注意力机制，同时加入可训练的衰减机制，在推理过程中决定移除哪些 token。该方法会对键值缓存（大型语言模型使用的内存）进行剪枝，同时不影响准确率。测试显示，在常规数据上，缓存大小可缩小 10 倍；处理 16,000-token 输入时，则可缩小 25 倍，同时下游任务表现仍有提升。

## 事实

- 自然语言任务中的 KV 缓存压缩 10 倍
- 序列长度为 16k token 时压缩 25 倍

## 为什么重要

缓存需求更低，意味着大型语言模型在内存有限的设备上部署起来成本更低、速度更快。

## 来源与参考

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

最后更新: 2026-10-08
