Исследователи представили новый метод ACG-WAM, который учит роботов выполнять действия на основе визуальных данных. В наборе из 50 симулированных задач RoboTwin 2.0 система справлялась в 93.46% случаев в чистых условиях и в 92.68% — при случайно изменённых сценах. В трёх задачах на реальных роботах она показала 85.00% полных успехов и 91.67% частичного выполнения, превзойдя прежнюю лучшую систему Motus на 10 и 9.17 процентного пункта соответственно.
Как работает ACG-WAM
Метод добавляет вспомогательный предсказатель, который учится на несколько шагов вперёд прогнозировать геометрические характеристики — например, положение и форму объектов — по текущему изображению с камеры робота и его будущим действиям. Предсказатель обучается на целевых данных, полученных от замороженного визуального кодировщика, который обрабатывает пары текущих и будущих изображений. После обучения вспомогательный предсказатель и учитель удаляются, и остаётся компактная модель, способная работать на роботе.
Что это значит для пользователей роботов
Более высокая успешность и в симуляциях, и на реальном оборудовании позволяет предположить, что роботы с ACG-WAM смогут надёжнее осваивать задачи, совершая меньше проб и ошибок. Для компаний, использующих роботов на заводах и складах, этот метод может сократить простои из-за неудачных попыток и ускорить обучение новым действиям.
Почему это важно
Для руководителя завода более высокие показатели успешности означают, что роботов можно быстрее обучать новым задачам и с меньшим числом ошибок, потенциально снижая затраты на обучение. Однако в статье не приводятся данные о долгосрочной надёжности и о том, насколько хорошо метод масштабируется на более сложные задачи, поэтому эти преимущества ещё предстоит подтвердить при широком внедрении.