Oossa

低ビットLLM量子化の精度を、推論コストを増やさず改善

研究チームが、量子化後に重みを調整するDistributionally Robust Quantization(DRQ)を提案。複数の手法で性能向上を確認した。

短信著者: Oossa公開日: 1 分で読める

Zhuo Sun氏率いるチームが、Distributionally Robust Quantization(DRQ)という手法をarXivで公開した。DRQは、さまざまな活性化分布における最悪ケースの再構成損失を最小化するよう、量子化済み重みの整数コードを調整する。重みのみを対象とする学習後量子化の後に適用でき、量子化グリッドと推論演算子は変更しない。実験では、AWQ、GPTQ、ParoQuantなど6つの手法で量子化済みのモデルにDRQを適用すると、密モデルとMixture-of-Experts(MoE)型LLMのどちらでも性能が向上した。

なぜ重要か

ハードウェアを変更したり実行時の処理負荷を増やしたりせずに、より小型で高速なLLMを高い精度で展開できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。