پژوهشگران PhysEvo را معرفی کردهاند؛ سامانهای که یک مدل رباتیکِ ثابت را در چرخهای از خودارزیابی و بازنگری ابزارها قرار میدهد. یک عامل وظیفه، ربات را به کار میاندازد و سپس عامل فرادستی بررسی میکند چه چیزی درست پیش نرفته، ابزارها یا مهارتها را بازنویسی میکند و اصلاحات را میآزماید. این چرخه میتواند روشهای تشخیصی خودِ عامل فرادستی را هم بهبود دهد؛ در نتیجه، بدون تغییر وزنهای مدل پایه، بهمرور پیشرفتها روی هم انباشته میشوند.
عملکرد آن چطور است؟
PhysEvo در معیار RoboDojo با 42 وظیفه و چیدمانهایی که پیشتر ندیده بود، آزمایش شد. نسخههای نگهداشتهشده از عامل بهطور میانگین امتیاز 68.14 از 100 گرفتند و در 62 ٪ وظایف موفق شدند. در مقایسه، بهترین عامل تکمرحلهای Astra که پیشتر منتشر شده بود (RoboDawn)، در همین وظایف به نرخ موفقیت 47.17 ٪ رسید. در هشت وظیفهٔ دشوارِ دستکاری اشیا، موفقیت PhysEvo به 55 ٪ رسید، در حالی که این رقم برای خط مبنای مستقیم Astra فقط 1.25 ٪ بود.
از شبیهسازی تا ربات واقعی
تیم، چارچوب کنترلی بهبودیافته در شبیهسازی را به ربات AgileX PiPER منتقل کرد و به اصلاح مهارتها روی سختافزار ادامه داد. این ربات در پنج وظیفهٔ دنیای واقعی و طی 25 آزمایش، بهطور میانگین امتیاز 90.60 گرفت و نرخ موفقیت 84 ٪ را ثبت کرد.
چرا مهم است
برای توسعهدهندگان ربات، PhysEvo نشان میدهد که میتوان بدون بازآموزی پرهزینه، تواناییهای یک مدل هوش مصنوعی ثابت را افزایش داد و در زمان محاسبات و داده صرفهجویی کرد. این روش همچنین نشان میدهد که میتوان با افزودن چرخهای مشابه برای خودارزیابی، رباتهای موجود را ارتقا داد و عمر مفیدشان را افزایش داد. با این حال، برای تأیید مستقل نتایج در دنیای واقعی، پژوهشهای بیشتری فراتر از این مطالعه لازم است.