Ein Forschungsteam hat OmniHOI vorgestellt – ein System, das gewöhnliche Videos aus einer einzelnen Kameraperspektive, in denen Menschen Gegenstände manipulieren, in Bewegungsabläufe für geschickte Roboterhände umwandelt. Die Arbeit befasst sich mit einem praktischen Problem: Ein Video zeigt die Hand nur aus einer Perspektive, und eine direkte Übertragung ihrer Bewegungen auf einen Roboter kann dazu führen, dass dieser einen Gegenstand nicht sicher festhält.
Laut den Autoren war OmniHOI bei 53 % von 60 Videoclips erfolgreich. Bei der leistungsstärksten zuvor entwickelten Video-zu-Roboter-Pipeline, die sie testeten, waren es 28 %. In einer separaten Testreihe übertrugen sie jeweils 150 Motion-Capture-Bewegungsabläufe auf fünf Roboterhände mit 6 bis 22 Freiheitsgraden – ein Maß dafür, auf wie viele Arten sich eine Hand bewegen kann. Die Erfolgsraten lagen zwischen 39 % und 89 %; frühere Übertragungsmethoden erreichten höchstens 31 %.
So funktioniert die Pipeline
OmniHOI besteht aus drei Schritten. Zunächst rekonstruiert das System anhand von Hinweisen im Video die Bewegungen von Hand und Gegenstand. Anschließend passt es die Bewegungen an die Kontakte zwischen Roboterhand und Gegenstand an und verfeinert sie dann in einer Physiksimulation, damit der resultierende Bewegungsablauf die Dynamik besser berücksichtigt.
Laut der Arbeit liefen die resultierenden Bewegungsabläufe bei einer Reihe von Aufgaben auch auf einem realen Roboter mit zwei Armen. Im Abstract werden weder der Roboter genannt noch Erfolgsraten für diese Tests mit dem realen Roboter angegeben. Die oben genannten Prozentwerte sollten daher nicht als Ergebnisse eines Einsatzes in der Praxis verstanden werden. Bei der Arbeit handelt es sich um eine Forschungsstudie; aus dem Abstract geht nicht hervor, ob das System oder der Code öffentlich verfügbar ist.
Was die Ergebnisse zeigen
Die Ergebnisse legen nahe, dass Videos von Menschen aus einer einzelnen Kameraperspektive nützliche Demonstrationen für Roboterhände liefern können, ohne dass dafür saubere Motion-Capture-Daten oder ein aufgabenspezifisches Reinforcement-Learning-Training nötig sind. Die Tests der Autoren werden im Abstract der Arbeit beschrieben; eine unabhängige Überprüfung wird darin nicht erwähnt.
Warum es wichtig ist
Für Robotikteams deuten die berichteten Ergebnisse auf eine mögliche Möglichkeit hin, Videos von Menschen beim Umgang mit Gegenständen in Demonstrationen für Roboterhände umzuwandeln, statt auf Motion-Capture-Bewegungsabläufe angewiesen zu sein. Das Abstract belegt jedoch nicht, wie gut das System über die beschriebenen Tests hinaus funktioniert oder ob andere Teams auf die Werkzeuge zugreifen können.