Onderzoekers hebben een nieuwe methode ontwikkeld, ACG-WAM, waarmee robots leren handelen op basis van visuele informatie. Bij 50 gesimuleerde taken in RoboTwin 2.0 slaagde het systeem in 93.46% van de gevallen in een onveranderde omgeving en in 92.68% wanneer de scènes werden gerandomiseerd. Bij drie taken in de echte wereld behaalde het een volledig succespercentage van 85.00% en een score van 91.67% voor gedeeltelijke voltooiing. Daarmee versloeg het de vorige beste methode, Motus, met respectievelijk 10 en 9.17 procentpunten.
Hoe ACG-WAM werkt
De methode voegt een aanvullende voorspeller toe die leert om enkele stappen vooruit geometrische kenmerken te voorspellen, zoals de positie en vorm van objecten. Daarbij gebruikt het model het actuele camerabeeld van de robot en de acties die deze gaat uitvoeren. De voorspeller wordt getraind met doelen die afkomstig zijn van een bevroren visuele encoder, die paren van huidige en toekomstige beelden verwerkt. Na de training worden de aanvullende voorspeller en de teachermodules verwijderd, zodat een compact model overblijft dat op de robot kan draaien.
Wat dit betekent voor robotgebruikers
De hogere succespercentages in simulaties en met echte robots wijzen erop dat robots met ACG-WAM taken mogelijk betrouwbaarder kunnen leren en minder vaak met vallen en opstaan hoeven te oefenen. Voor bedrijven die robots inzetten in fabrieken of magazijnen kan de methode de uitvaltijd door mislukte pogingen beperken en de tijd verkorten die nodig is om robots nieuwe taken aan te leren.
Waarom het ertoe doet
Voor een fabrieksmanager betekenen de hogere succespercentages dat robots mogelijk sneller en met minder fouten nieuwe taken kunnen leren, wat de trainingskosten kan drukken. Het artikel rapporteert echter niet over betrouwbaarheid op de lange termijn of over hoe de methode opschaalt naar complexere taken. Die voordelen moeten dus nog worden bevestigd bij inzet op grotere schaal.