研究者らは、ロボットの視覚・言語・行動ポリシーと、その実行を統括するオーケストレーターを実運用中に同時に微調整する手法「Robo‑COP」を発表した。このシステムは自らの失敗データを集めてポリシーを更新し、学習に使ったタスクで新しいバージョンのほうが優れていると確認できた場合にのみ採用する。シミュレーション上のRoboLabの10タスクでは成功率が64.8%から73.8%に上昇し、実環境の3タスクでは38.3%から50.0%に伸びた。
なぜ重要か
サービスロボットが現場で稼働しながら性能を高められるため、手作業で頻繁に再プログラムする必要を減らせる。