Un equipo de investigadores presentó ACG-WAM, un nuevo método para enseñar a los robots a actuar a partir de información visual. En un conjunto de 50 tareas simuladas de RoboTwin 2.0, el sistema tuvo éxito el 93.46% de las veces en entornos despejados y el 92.68% cuando las escenas se aleatorizaron. En tres tareas del mundo real, alcanzó un 85.00% de éxito total y un 91.67% de finalización parcial, con lo que superó al sistema que hasta entonces tenía el mejor resultado, Motus, por 10 y 9.17 puntos porcentuales, respectivamente.
Cómo funciona ACG-WAM
El método incorpora un predictor auxiliar que aprende a anticipar, varios pasos por adelantado, características geométricas —como la posición y la forma de los objetos— a partir de la imagen actual de la cámara del robot y de las acciones que este realizará. El predictor se entrena con objetivos obtenidos de un codificador visual congelado, que procesa pares de imágenes actuales y futuras. Una vez terminado el entrenamiento, se eliminan el predictor adicional y los módulos docentes, y queda un modelo compacto que puede funcionar en el robot.
Qué significa para quienes usan robots
Las mayores tasas de éxito tanto en simulaciones como en robots reales sugieren que los robots que usan ACG-WAM podrían aprender tareas con más fiabilidad y menos ensayo y error. Para las empresas que utilizan robots en fábricas o almacenes, el método podría reducir el tiempo de inactividad causado por intentos fallidos y acortar el tiempo necesario para enseñar nuevos comportamientos.
Por qué importa
Para quien dirige una fábrica, las mayores tasas de éxito significan que los robots podrían aprender nuevas tareas más rápido y con menos errores, lo que podría reducir los costos de capacitación. Sin embargo, el artículo no informa sobre la fiabilidad a largo plazo ni sobre cómo escala el método a tareas más complejas, por lo que esos beneficios aún deben confirmarse en implementaciones más amplias.