Forschende haben mit ACG-WAM eine neue Methode vorgestellt, mit der Roboter lernen, anhand visueller Eingaben zu handeln. Bei 50 simulierten Aufgaben in RoboTwin 2.0 war das System in unveränderten Umgebungen in 93.46% der Fälle erfolgreich, bei randomisierten Szenen in 92.68%. Bei drei Aufgaben in der realen Welt erzielte es eine vollständige Erfolgsquote von 85.00% und einen Wert von 91.67% bei teilweiser Erfüllung. Damit übertraf es das bisher beste System, Motus, um 10 beziehungsweise 9.17 Prozentpunkte.
So funktioniert ACG-WAM
Die Methode ergänzt einen Hilfsprädiktor, der mehrere Schritte im Voraus geometrische Merkmale wie die Position und Form von Objekten vorhersagt. Dafür nutzt er die aktuelle Kamerasicht des Roboters und die Aktionen, die dieser ausführen wird. Trainiert wird der Prädiktor mit Zielwerten aus einem eingefrorenen visuellen Encoder, der Paare aktueller und zukünftiger Bilder verarbeitet. Nach dem Training werden der zusätzliche Prädiktor und die Lehrermodule entfernt. Übrig bleibt ein schlankes Modell, das auf dem Roboter laufen kann.
Was das für Anwender bedeutet
Die höheren Erfolgsquoten sowohl in Simulationen als auch mit realer Hardware deuten darauf hin, dass Roboter mit ACG-WAM Aufgaben zuverlässiger und mit weniger Ausprobieren lernen könnten. Für Unternehmen, die Roboter in Fabriken oder Lagerhallen einsetzen, könnte die Methode Ausfallzeiten durch fehlgeschlagene Versuche verringern und die Zeit verkürzen, die zum Anlernen neuer Verhaltensweisen benötigt wird.
Warum es wichtig ist
Für die Leitung eines Werks bedeuten die höheren Erfolgswerte, dass Roboter neue Aufgaben möglicherweise schneller und mit weniger Fehlern erlernen können. Das könnte die Schulungskosten senken. Die Arbeit macht jedoch keine Angaben zur langfristigen Zuverlässigkeit oder dazu, wie gut sich die Methode auf komplexere Aufgaben übertragen lässt. Diese Vorteile müssen sich daher erst noch in größeren Einsätzen bestätigen.