# WAM-Cache让机器人视觉计算量最多减少42%

> 这项免训练缓存技术可降低视频模型的计算成本，同时将操作准确率的差距控制在几个百分点以内。

Oossa · 2026-10-09 · https://oossa.com/zh/wam-cache-cuts-robot-vision-compute-by-up-to-42

由Kai Ding带领的研究团队发布了WAM-Cache框架，可在不同控制片段间复用视频扩散Transformer的键值表示。系统不再每一步都重新计算整个视觉编码器，而是根据动作专家的注意力和视觉惊异度指标，挑选少量令牌进行更新，并严格限制缓存的使用时长。在Fast-WAM基准测试中，WAM-Cache在RoboTwin 2.0、LIBERO和真实场景测试中将视频编码器的FLOPs降低了32‑42%；与完整计算基线相比，其模拟环境表现仅低0.7‑1.8个百分点，在真实机器人上的表现低2.5个百分点。

## 事实

- WAM-Cache在Fast-WAM基准测试中将视频DiT预填充FLOPs降低32‑42%。
- 准确率在模拟环境中最多下降1.8 %，在真实机器人上下降2.5 %。

## 为什么重要

机器人开发者可以用成本更低的硬件运行高性能操作策略，同时不会明显降低成功率。

## 来源与参考

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

最后更新: 2026-10-09
