Ahan Gupta氏が率いるチームは、新たなアーキテクチャ「Universal Attention」を発表した。標準的なRoPE位置埋め込みとSoftmax attentionを維持しつつ、推論時に削除するトークンを決める学習可能な減衰メカニズムを追加している。この手法は、大規模言語モデルが使用するメモリーであるキー・バリューキャッシュを、精度を損なうことなく削減する。テストでは、一般的なデータでキャッシュ容量を10分の1に、16,000トークンの入力処理では25分の1に抑えながら、下流タスクの性能も向上した。
なぜ重要か
キャッシュに必要なメモリーが減れば、メモリーが限られたデバイスでも、大規模言語モデルをより低コストかつ高速に展開できる。