연구진은 로봇이 실제로 사용되는 동안 비전·언어·행동 정책과 오케스트레이터를 함께 미세 조정하는 방법인 Robo-COP를 선보였다. 시스템은 스스로 실수 데이터를 수집해 정책을 업데이트하고, 학습에 사용한 작업에서 성능이 더 좋다는 점이 확인된 뒤에야 새 버전을 적용한다. 시뮬레이션 환경의 RoboLab 작업 10개에서는 성공률이 64.8%에서 73.8%로 올랐고, 실제 환경 작업 3개에서는 38.3%에서 50.0%로 상승했다.
왜 중요한가
서비스 로봇이 현장에서 스스로 성능을 높일 수 있어, 사람이 자주 수동으로 재프로그래밍할 필요가 줄어든다.