研究者らは、圧縮された言語モデルの性能を高める手法「Low‑Rank Conditional Computation(LRCC)」を発表した。各Transformerブロックに小型のルーターを設け、現在のトークンに応じて複数の低ランク経路から1つを選ぶ。学習するのはルーターだけで、低ランク行列は固定したままだ。Llama‑2‑7B、Llama‑3.2‑1B、Qwenで評価したところ、LRCCは静的な低ランク圧縮と比べ、Llama‑2‑7Bの下流タスク精度を7.6ポイント向上させた。また、デコード速度を変えずに、より良いパープレキシティを達成した。
なぜ重要か
開発者は、計算コストを抑えながら精度を保つ、トークンごとに経路を切り替えるモデルを実行できる。LlamaやQwenを使うアプリケーションの計算コスト削減につながる。