Oossa

自剪枝 Transformer 将 KV 缓存缩小至原来的 1/25

研究人员推出 Universal Attention:一种可训练方法,能自适应地移除影响较小的 token。在常见任务中可将缓存压缩 10 倍,处理 16k token 序列时可压缩 25 倍。

简讯作者: Oossa 发布日期: 1 分钟阅读

由 Ahan Gupta 领导的团队推出了一种名为 Universal Attention 的新架构。它保留了标准的 RoPE 位置嵌入和 Softmax 注意力机制,同时加入可训练的衰减机制,在推理过程中决定移除哪些 token。该方法会对键值缓存(大型语言模型使用的内存)进行剪枝,同时不影响准确率。测试显示,在常规数据上,缓存大小可缩小 10 倍;处理 16,000-token 输入时,则可缩小 25 倍,同时下游任务表现仍有提升。

为什么重要

缓存需求更低,意味着大型语言模型在内存有限的设备上部署起来成本更低、速度更快。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。