Oossa

WAM-Cache让机器人视觉计算量最多减少42%

这项免训练缓存技术可降低视频模型的计算成本,同时将操作准确率的差距控制在几个百分点以内。

简讯作者: Oossa 发布日期: 1 分钟阅读

由Kai Ding带领的研究团队发布了WAM-Cache框架,可在不同控制片段间复用视频扩散Transformer的键值表示。系统不再每一步都重新计算整个视觉编码器,而是根据动作专家的注意力和视觉惊异度指标,挑选少量令牌进行更新,并严格限制缓存的使用时长。在Fast-WAM基准测试中,WAM-Cache在RoboTwin 2.0、LIBERO和真实场景测试中将视频编码器的FLOPs降低了32‑42%;与完整计算基线相比,其模拟环境表现仅低0.7‑1.8个百分点,在真实机器人上的表现低2.5个百分点。

为什么重要

机器人开发者可以用成本更低的硬件运行高性能操作策略,同时不会明显降低成功率。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。