由 Ahan Gupta 领导的团队推出了一种名为 Universal Attention 的新架构。它保留了标准的 RoPE 位置嵌入和 Softmax 注意力机制,同时加入可训练的衰减机制,在推理过程中决定移除哪些 token。该方法会对键值缓存(大型语言模型使用的内存)进行剪枝,同时不影响准确率。测试显示,在常规数据上,缓存大小可缩小 10 倍;处理 16,000-token 输入时,则可缩小 25 倍,同时下游任务表现仍有提升。
为什么重要
缓存需求更低,意味着大型语言模型在内存有限的设备上部署起来成本更低、速度更快。