研究者らは、変化しない単一のロボットモデルを、自己診断とツール改良のループに組み込むシステム「PhysEvo」を発表した。タスクエージェントがロボットを動かし、次にメタエージェントが失敗の原因を調べてツールやスキルを書き換え、修正を試す。このループでは、メタエージェント自身の診断手法も改善できるため、基盤モデルの重みを変えずに改良を積み重ねられる。
性能はどれほど?
RoboDojoベンチマークでは、PhysEvoを未経験のレイアウトで行う42のタスクで評価した。保存されたエージェントのバージョンは平均68.14点(100点満点)を獲得し、タスクの62%に成功した。同じタスクで、公開済みの単発実行型Astraエージェントの最高成績であるRoboDawnは、成功率47.17%だった。特に難しい8つの操作タスクでは、PhysEvoの成功率は55%に達した一方、Astraを直接使うベースラインは1.25%にとどまった。
シミュレーションから実機へ
チームは、シミュレーションで進化させた制御の仕組みをAgileX PiPERロボットに移し、実機上でもスキルの改良を続けた。実世界の5つのタスクで25回試行した結果、ロボットは平均90.60点を獲得し、成功率は84%だった。
なぜ重要か
ロボット開発者にとってPhysEvoは、コストのかかる再学習を行わなくても、固定されたAIモデルの能力を高められる可能性を示している。計算時間やデータを節約できるほか、同様の自己診断ループを加えれば、既存のロボットをアップグレードして有用な期間を延ばせる可能性もある。ただし、この研究以外での独立した実環境検証はまだ必要だ。