शोधकर्ताओं ने PhysEvo पेश किया है। यह एक ऐसे चक्र के ज़रिए रोबोट के एक ही, अपरिवर्तित मॉडल को बेहतर बनाता है जिसमें मॉडल अपनी गलतियों का पता लगाता है और टूल में संशोधन करता है। एक टास्क एजेंट रोबोट को चलाता है, फिर एक मेटा-एजेंट देखता है कि क्या गलत हुआ, टूल या कौशल को नए सिरे से लिखता है और सुधारों को परखता है। यह चक्र मेटा-एजेंट की अपनी निदान संबंधी तरकीबों को भी बेहतर बना सकता है। इस तरह समय के साथ सुधार जुड़ते जाते हैं, जबकि मूल मॉडल के वज़न नहीं बदलते।
यह कितना कारगर है?
RoboDojo बेंचमार्क में PhysEvo को ऐसे लेआउट वाले 42 कामों पर परखा गया जिन्हें उसने पहले नहीं देखा था। एजेंट के उन संस्करणों ने, जिन्हें आगे इस्तेमाल के लिए रखा गया, औसतन 100 में से 68.14 अंक हासिल किए और 62 % कामों में सफल रहे। इसके मुकाबले, Astra के सबसे अच्छे प्रकाशित वन-शॉट एजेंट RoboDawn ने उन्हीं कामों में 47.17 % सफलता हासिल की। खास तौर पर चुनौतीपूर्ण आठ मैनिपुलेशन कामों में PhysEvo 55 % बार सफल हुआ, जबकि सीधे Astra का इस्तेमाल करने वाला आधार मॉडल केवल 1.25 % बार सफल हुआ।
सिमुलेशन से असली रोबोट तक
टीम ने सिमुलेशन में विकसित कंट्रोल हार्नेस को AgileX PiPER रोबोट पर लागू किया और हार्डवेयर पर कौशल में सुधार जारी रखा। असली दुनिया के पांच कामों और 25 परीक्षणों में रोबोट ने औसतन 90.60 अंक हासिल किए और 84 % सफलता दर दर्ज की।
यह क्यों मायने रखता है
रोबोट बनाने वालों के लिए PhysEvo दिखाता है कि महंगे रीट्रेनिंग के बिना भी एक स्थिर AI मॉडल को अधिक सक्षम बनाया जा सकता है, जिससे कंप्यूटिंग समय और डेटा की बचत होती है। इससे यह भी संकेत मिलता है कि इसी तरह का आत्म-निदान चक्र जोड़कर मौजूदा रोबोटों को बेहतर बनाया जा सकता है और उनका उपयोगी जीवन बढ़ाया जा सकता है। हालांकि, इस अध्ययन से परे असली दुनिया में स्वतंत्र सत्यापन की अब भी ज़रूरत है।