Kyoungin Baik이 이끄는 연구팀은 로봇 시뮬레이션 데이터만으로 비전·언어·행동(VLA) 모델을 학습하는 프레임워크 SimVLA를 공개했다. 시스템은 먼저 이동형 조작 작업 35가지를 다루는 SimAction과 세밀한 시각·언어 지도 데이터를 추가한 SimVQA, 두 가지 대규모 시뮬레이션 데이터셋으로 학습한다. 이후 시뮬레이션에서 생성한 실행 데이터를 추가로 학습한 SimVLA를 선반에 물건 채우기, 액체 따르기, 청소 같은 실제 작업에서 시험했다. 시험 결과 SimVLA는 실제 환경에서 수집한 시연 데이터 50개로 학습한 정책보다 우수한 성능을 보여, 비용이 많이 드는 실제 데이터 수집을 시뮬레이션으로 대체할 수 있음을 나타냈다.
왜 중요한가
로봇이 시뮬레이션만으로 학습할 수 있다면 제조업체는 가정용 보조 로봇을 더 빠르고 저렴하게 개발할 수 있다.