研究チームは、人が物を扱う様子を一般的な単眼カメラで撮影した動画から、器用なロボットハンドの動作軌道を生成するシステム「OmniHOI」を発表しました。この研究が取り組むのは、実用上の課題です。動画に映る手は一方向からしか見えず、その動きをそのままロボットに移すと、物をつかみ続けられない動作になることがあります。
著者らによると、OmniHOIは60本の動画クリップのうち53%で成功しました。比較対象とした従来の動画からロボットへの変換パイプラインのうち、最も高い成功率は28%でした。別のテストでは、モーションキャプチャで取得した150件の軌道を、自由度が6~22のロボットハンド5種類それぞれに転写しました。自由度とは、ハンドが動ける方向や方法の数を示す尺度です。成功率は39~89%で、従来の転写手法では最高でも31%でした。
パイプラインの仕組み
OmniHOIは3段階で構成されています。まず、動画に含まれる手がかりを使って手と物体の動きを再構成します。次に、ロボットハンドと物体の接触に合うよう動きを調整し、最後に物理シミュレーションで動作を洗練させ、力学的な影響をより適切に反映します。
論文によると、生成された軌道は、さまざまなタスクで両腕を備えた実機ロボットでも実行できました。ただし、論文要旨ではロボットの名称や実機での成功率は明らかにされていません。そのため、上記の成功率を実環境での導入実績とみなすべきではありません。この研究は論文として発表されたもので、システムやコードが一般公開されているかどうかは要旨に記載されていません。
結果から分かること
今回の結果は、鮮明なモーションキャプチャデータやタスクごとの強化学習トレーニングを使わなくても、単眼カメラで撮影した人の動画がロボットハンドの有用なデモンストレーションになり得ることを示唆しています。著者らのテスト結果は論文要旨に記載されていますが、独立した検証については説明されていません。
なぜ重要か
ロボット開発チームにとって、今回の結果は、モーションキャプチャの軌道に頼らず、人が物を扱う動画からロボットハンドのデモンストレーションを作れる可能性を示しています。ただし、要旨だけでは、報告されたテスト以外でどの程度機能するのか、また他のチームがツールを利用できるのかは分かりません。