# WAM-Cache、ロボットの視覚処理計算を最大42％削減

> 新たな学習不要のキャッシュ技術により、動画モデルの計算コストを抑えつつ、操作精度の低下を数ポイントにとどめる。

Oossa · 2026-10-09 · https://oossa.com/ja/wam-cache-cuts-robot-vision-compute-by-up-to-42

Kai Ding氏らの研究チームは、動画拡散トランスフォーマーのキー・バリュー表現を制御チャンク間で再利用するフレームワーク「WAM-Cache」を発表した。各ステップで視覚エンコーダー全体を再計算する代わりに、行動エキスパートのアテンションと視覚的な意外性の指標に基づいて選んだ少数のトークンだけを、厳格な経過時間の上限を設けて更新する。Fast-WAMベンチマークでは、RoboTwin 2.0、LIBEROおよび実環境のテストで動画エンコーダーのFLOPsを32～42％削減。シミュレーションでは高密度ベースラインとの精度差を0.7～1.8ポイント以内に、実機では2.5ポイントに抑えた。

## 事実

- WAM-Cacheは、Fast-WAMベンチマークで動画DiTのプレフィルFLOPsを32～42％削減する。
- 精度の低下は、シミュレーションで最大1.8％、実機で2.5％。

## なぜ重要か

ロボット開発者は、成功率を大きく下げることなく、より低コストなハードウェアで高性能な操作ポリシーを実行できる。

## 出典と参考資料

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

最終更新: 2026-10-09
