Oossa

LRCC让低秩压缩大模型按Token动态计算

LRCC新方法让Llama和Qwen模型为每个Token选择更省资源或更丰富的计算路径,无需额外硬件即可提高准确率。

简讯作者: Oossa 发布日期: 1 分钟阅读

研究人员推出低秩条件计算(LRCC),旨在提升压缩语言模型的能力。它为每个Transformer模块配备一个小型路由器,根据当前Token从多个低秩路径中进行选择。训练时只调整路由器,低秩矩阵保持冻结。在Llama‑2‑7B、Llama‑3.2‑1B和Qwen上进行的测试显示,与静态低秩压缩相比,LRCC使Llama‑2‑7B的下游准确率提高了7.6个百分点;在解码速度相同的情况下,困惑度也更低。

为什么重要

开发者可以运行成本更低、能按Token动态调整计算的模型,同时保持准确度,为使用Llama或Qwen的应用节省计算成本。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。