Kyoungin Baik氏が率いるチームは、シミュレーション上のロボットデータだけで視覚・言語・行動(VLA)モデルを訓練するフレームワーク「SimVLA」を公開した。このシステムはまず、移動しながら物を扱う35種類のタスクを網羅した「SimAction」と、詳細な視覚・言語による教師信号を加える「SimVQA」という2つの大規模なシミュレーションデータセットから学習する。さらに、シミュレーション上の実行データで追加訓練した後、棚への商品の補充、液体を注ぐ作業、掃除など、現実世界のタスクで性能を検証した。その結果、現実世界で収集した50件の実演データで訓練した方策を上回り、コストのかかる現実世界でのデータ収集をシミュレーションで代替できる可能性を示した。
なぜ重要か
ロボットがシミュレーションだけで学習できれば、メーカーは家庭用アシスタントをより速く、低コストで開発できる。