# 自己削減型Transformer、KVキャッシュを最大25分の1に

> 研究チームが、影響の小さいトークンを学習によって動的に削除する「Universal Attention」を発表。一般的なタスクでは10分の1に圧縮し、16kトークンの系列では25分の1を実現する。

Oossa · 2026-10-08 · https://oossa.com/ja/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Ahan Gupta氏が率いるチームは、新たなアーキテクチャ「Universal Attention」を発表した。標準的なRoPE位置埋め込みとSoftmax attentionを維持しつつ、推論時に削除するトークンを決める学習可能な減衰メカニズムを追加している。この手法は、大規模言語モデルが使用するメモリーであるキー・バリューキャッシュを、精度を損なうことなく削減する。テストでは、一般的なデータでキャッシュ容量を10分の1に、16,000トークンの入力処理では25分の1に抑えながら、下流タスクの性能も向上した。

## 事実

- 自然言語タスクでKVキャッシュを10分の1に圧縮
- 16kトークンの系列で25分の1に圧縮

## なぜ重要か

キャッシュに必要なメモリーが減れば、メモリーが限られたデバイスでも、大規模言語モデルをより低コストかつ高速に展開できる。

## 出典と参考資料

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

最終更新: 2026-10-08
