Oossa

新方法提升低比特 LLM 量化效果,推理成本不变

研究人员提出分布鲁棒量化(DRQ),在训练后量化后进一步优化权重,提升多种方法的模型表现。

简讯作者: Oossa 发布日期: 1 分钟阅读

由 Zhuo Sun 领导的团队在 arXiv 上发布了一种名为分布鲁棒量化(DRQ)的方法。DRQ 会调整量化权重的整数编码,以降低不同激活分布下最坏情况下的重建损失。它适用于仅对权重进行的训练后量化,不会改变量化网格或推理算子。实验显示,DRQ 能提升已采用六种量化方法的模型表现,包括 AWQ、GPTQ 和 ParoQuant,适用于稠密型和混合专家(MoE)LLM。

为什么重要

开发者无需更换硬件或增加运行时开销,就能部署更小、更快且准确度更高的 LLM。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。