연구진은 기존 로봇 월드 모델에 시뮬레이션으로 만든 실패 사례를 추가하는 기법 CureWM을 공개했다. 성공한 시연을 바탕으로 다른 행동을 구성한 뒤, 시뮬레이션이나 실제 로봇 팔에서 그 결과를 확인하고 검증된 실패 사례로 모델을 미세 조정한다. 학습에 사용하지 않은 LIBERO 작업 484개에서 미세 조정한 모델 4개의 과도한 낙관 예측 비율은 80%에서 30~43%로 낮아졌다. 실제 로봇 테스트에서는 거짓 성공 점수가 90%에서 33%로 떨어졌다.
왜 중요한가
거짓 성공 예측이 줄면 로봇 계획 시스템이 실제 환경에 배치됐을 때 위험한 행동을 피하는 데 도움이 된다.