أطلق فريق بقيادة كيونغين بايك SimVLA، وهو إطار لتدريب نماذج الرؤية واللغة والفعل (VLA) بالكامل على بيانات روبوتية محاكاة. يبدأ النظام التعلم من مجموعتي بيانات محاكاتين كبيرتين: SimAction، التي تغطي 35 مهمة للتنقل والتلاعب بالأشياء، وSimVQA، التي تضيف إشرافًا تفصيليًا يجمع بين الصور واللغة. وبعد تدريب إضافي على مسارات تنفيذ محاكاة، اختُبر SimVLA في مهام واقعية، مثل إعادة ملء الأرفف وسكب السوائل والتنظيف. وفي هذه الاختبارات، تفوق على سياسات دُرّبت باستخدام 50 عرضًا توضيحيًا من العالم الحقيقي، ما يشير إلى أن المحاكاة قد تغني عن جمع بيانات واقعية مكلفة.
لماذا يهم
إذا تمكنت الروبوتات من التعلم بالاعتماد على المحاكاة وحدها، فقد يطوّر المصنعون مساعدين منزليين بسرعة أكبر وبتكلفة أقل.