研究人员推出低秩条件计算(LRCC),旨在提升压缩语言模型的能力。它为每个Transformer模块配备一个小型路由器,根据当前Token从多个低秩路径中进行选择。训练时只调整路由器,低秩矩阵保持冻结。在Llama‑2‑7B、Llama‑3.2‑1B和Qwen上进行的测试显示,与静态低秩压缩相比,LRCC使Llama‑2‑7B的下游准确率提高了7.6个百分点;在解码速度相同的情况下,困惑度也更低。
为什么重要
开发者可以运行成本更低、能按Token动态调整计算的模型,同时保持准确度,为使用Llama或Qwen的应用节省计算成本。