Исследователи представили PhysEvo — систему, которая запускает одну неизменяемую модель робота в цикле самодиагностики и доработки инструментов. Агент выполняет задачу, затем метаагент анализирует ошибки, переписывает инструменты или навыки и проверяет исправления. Цикл позволяет совершенствовать и собственные методы диагностики метаагента, поэтому улучшения накапливаются со временем без изменения весов базовой модели.
Насколько хорошо это работает?
PhysEvo протестировали на 42 задачах бенчмарка RoboDojo с незнакомыми модели вариантами расположения объектов. Сохранённые версии агента набрали в среднем 68.14 из 100 баллов и справились с 62 % задач. Для сравнения: лучший опубликованный агент Astra, работающий за один проход, — RoboDawn — успешно выполнил 47.17 % тех же задач. На восьми особенно сложных задачах на манипуляцию PhysEvo показал результат 55 %, тогда как базовый вариант с прямым использованием Astra справился лишь в 1.25 % случаев.
От симуляции к реальному роботу
Команда перенесла управляющую систему, эволюционировавшую в симуляции, на робота AgileX PiPER и продолжила дорабатывать навыки уже на самом устройстве. В пяти задачах из реального мира и 25 испытаниях робот набрал в среднем 90.60 балла, а доля успешных попыток составила 84 %.
Почему это важно
Для разработчиков роботов PhysEvo показывает, что возможности одной неизменяемой модели ИИ можно расширить без дорогостоящего дообучения, сэкономив вычислительные ресурсы и данные. Это также позволяет предположить, что существующих роботов можно модернизировать, добавив аналогичный цикл самодиагностики, и тем самым продлить срок их полезной эксплуатации. Однако необходима независимая проверка результатов в реальных условиях за пределами этого исследования.