研究者らが、視覚入力に基づいてロボットの動作を学習させる新手法「ACG-WAM」を発表した。RoboTwin 2.0のシミュレーション課題50種類では、環境が整った状態で93.46%、シーンをランダム化した状態で92.68%の成功率を記録した。実世界の3課題では、完全成功率が85.00%、部分達成率が91.67%となり、従来の最高性能システム「Motus」をそれぞれ10ポイント、9.17ポイント上回った。
ACG-WAMの仕組み
この手法では、ロボットの現在のカメラ映像とこれから行う動作を使い、物体の位置や形状などの幾何学的特徴を数ステップ先まで予測する補助予測器を追加する。予測器の学習には、現在と将来の画像のペアを処理する、固定状態の視覚エンコーダーが生成した目標値を使う。学習後は補助予測器と教師役のモジュールを取り除き、ロボット上で動作する軽量なモデルだけを残す。
ロボットの利用者にとっての意味
シミュレーションと実機の両方で成功率が高まったことから、ACG-WAMを使うロボットは、試行錯誤を減らしながら、より確実に作業を学習できる可能性がある。工場や倉庫にロボットを導入する企業にとっては、失敗による稼働停止を減らし、新しい動作を教える時間を短縮できる可能性がある。
なぜ重要か
工場の管理者にとって、成功率の向上は、ロボットに新しい仕事をより速く、より少ないミスで教えられ、訓練コストを削減できる可能性を意味する。ただし、論文では長期的な信頼性や、より複雑な課題への適用性は報告されていない。そのため、こうした効果が大規模な導入でも得られるかは、今後確認する必要がある。