Oossa

自己削減型Transformer、KVキャッシュを最大25分の1に

研究チームが、影響の小さいトークンを学習によって動的に削除する「Universal Attention」を発表。一般的なタスクでは10分の1に圧縮し、16kトークンの系列では25分の1を実現する。

短信著者: Oossa公開日: 1 分で読める

Ahan Gupta氏が率いるチームは、新たなアーキテクチャ「Universal Attention」を発表した。標準的なRoPE位置埋め込みとSoftmax attentionを維持しつつ、推論時に削除するトークンを決める学習可能な減衰メカニズムを追加している。この手法は、大規模言語モデルが使用するメモリーであるキー・バリューキャッシュを、精度を損なうことなく削減する。テストでは、一般的なデータでキャッシュ容量を10分の1に、16,000トークンの入力処理では25分の1に抑えながら、下流タスクの性能も向上した。

なぜ重要か

キャッシュに必要なメモリーが減れば、メモリーが限られたデバイスでも、大規模言語モデルをより低コストかつ高速に展開できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。