研究人员推出了一种名为 ACG-WAM 的新方法,旨在教机器人根据视觉输入采取行动。在 RoboTwin 2.0 的 50 项模拟任务中,该系统在干净环境下的成功率为 93.46%,在场景随机化后为 92.68%。在三项真实世界任务中,它的完全成功率达到 85.00%,部分完成率为 91.67%;相比之下,此前表现最佳的系统 Motus 分别低 10 和 9.17 个百分点。
ACG-WAM 如何运作
这种方法加入了一个辅助预测器,可根据机器人当前的摄像头画面及其将要执行的动作,提前数步预测物体的位置、形状等几何特征。训练时,预测器以一个冻结的视觉编码器生成的目标为依据;该编码器会处理当前图像与未来图像的配对数据。训练完成后,额外的预测器和教师模块会被移除,只留下一个精简模型供机器人运行。
这对机器人用户意味着什么
模拟环境和真实硬件上的成功率都有所提高,说明使用 ACG-WAM 的机器人或许能以更少的反复试错,更可靠地学会执行任务。对于在工厂或仓库部署机器人的企业来说,这种方法有望减少尝试失败造成的停机时间,也能缩短训练机器人掌握新行为所需的时间。
为什么重要
对工厂管理者而言,更高的成功率意味着机器人可能更快学会新工作、出错更少,从而有望降低培训成本。不过,论文没有报告长期可靠性,也未说明这种方法能否扩展到更复杂的任务,因此这些优势仍有待在更大规模的部署中验证。