Исследователи представили Robo‑COP — метод, при котором политику робота, объединяющую зрение, язык и действия, и оркестратор совместно дообучают во время реальной работы. Система собирает данные о собственных ошибках, обновляет политику и внедряет новую версию, только если та показывает лучшие результаты на задачах, для которых её обучали. В десяти симулированных задачах RoboLab успешность выросла с 64.8% до 73.8%, а в трёх задачах в реальных условиях — с 38.3% до 50.0%.
Почему это важно
Сервисные роботы смогут совершенствоваться прямо во время работы, и их не придётся часто перепрограммировать вручную.