Huang Huang氏率いるチームは、シミュレーション上のロボットの動きをリアルなRGB動画に変換するシステム「RoboRender」を発表した。このモデルは深度動画、言語による指示、ロボットのマスクを使い、動作や行動の内容は保ったまま、現実世界の質感や背景を加える。生成動画で学習した制御ポリシーを、物体のピック&プレース、関節のある物体の操作、移動ロボットによる操作の各タスクで実機検証したところ、成功率は71%だった。これは、シミュレーションの生のレンダリング画像で学習した場合の約7.1倍、標準的な視覚ドメインランダム化を使った場合の3.6倍に当たる。
なぜ重要か
ロボット開発者はシミュレーションで制御器を学習させ、そのまま実機に導入できるため、コストのかかる実世界のデータ収集を減らせる。