Oossa

LRCC、低ランク圧縮LLMにトークン別の計算経路を導入

新手法LRCCは、トークンごとに計算量の少ない経路と豊かな経路をLlamaやQwenモデルに選ばせ、追加のハードウェアなしで精度を高める。

短信著者: Oossa公開日: 1 分で読める

研究者らは、圧縮された言語モデルの性能を高める手法「Low‑Rank Conditional Computation(LRCC)」を発表した。各Transformerブロックに小型のルーターを設け、現在のトークンに応じて複数の低ランク経路から1つを選ぶ。学習するのはルーターだけで、低ランク行列は固定したままだ。Llama‑2‑7B、Llama‑3.2‑1B、Qwenで評価したところ、LRCCは静的な低ランク圧縮と比べ、Llama‑2‑7Bの下流タスク精度を7.6ポイント向上させた。また、デコード速度を変えずに、より良いパープレキシティを達成した。

なぜ重要か

開発者は、計算コストを抑えながら精度を保つ、トークンごとに経路を切り替えるモデルを実行できる。LlamaやQwenを使うアプリケーションの計算コスト削減につながる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。