Weizhe Xu氏らの研究チームは、ロボットの計画を生成する大規模推論言語モデル(LRLM)の動作を監視するツール、SafeInferComを公開した。このツールはモデルの生成を中断せずに各ステップを検証し、妥当な途中段階の計画を保持しながら、誤りを早期に修正する。複数のLRLMとVirtualHomeシミュレーターを使ったテストでは、計画の成功率が向上し、必要なトークン数も減少した。反復的な改善と組み合わせた場合に、特に効果が大きかった。チームは実際のロボットアームを使った実証も行った。
なぜ重要か
ロボット開発者は、より信頼性の高い計画を短時間で得られるため、実環境でロボットを稼働させる際の計算資源と時間を節約できる。