أطلقت شركة Odyssey الناشئة في مجال الذكاء الاصطناعي، ومقرها كاليفورنيا، معاينة بحثية عامة لنموذجها للعوالم Odyssey‑3. ويمكن لأي شخص تجربة العرض المجاني عبر الإنترنت، الذي ينشئ بيئات تفاعلية انطلاقاً من وصف نصي، ويتيح للمستخدمين التنقل فيها بمنظور الشخص الأول أو الثالث. كما يمكن للمطورين التقدّم للحصول على إمكانية الوصول إلى واجهة API لدمج النموذج في مشاريعهم.
ما الذي يستطيع النموذج فعله؟
ينشئ Odyssey‑3 إطارات الفيديو في الوقت الفعلي باستخدام محوّل انتشار تسلسلي ذاتي، وهو نوع من الذكاء الاصطناعي يتنبأ بكل إطار استناداً إلى الإطار السابق وإلى تصرفات المستخدم. ويضم النموذج الأساسي 14 billion من المعلمات، وينتج فيديو بدقة 832 × 480 pixels؛ أما الإصدار الأعلى Odyssey‑3 Pro فيعمل بدقة 1280 × 720 pixels. وتقول الشركة إن النموذج يتعلم العلاقات بين السبب والنتيجة من مقاطع الفيديو المنشورة على الإنترنت، ولقطات الألعاب المصحوبة بسجلات الإدخال، ومشاهد الفيزياء المحاكاة.
المعايير والاختبارات الأولية
تقول Odyssey إن النموذج حقق أعلى نتيجة بلغت 66.1 نقطة في معيار Physics‑IQ Verified لتحويل الفيديو إلى فيديو، لكن الرقم القياسي سُجل في تشغيل واحد، مع خطوة انتقاء لا تتوافق مع القواعد القياسية للمعيار. ومن دون تلك الخطوة، بلغ متوسط النموذج 63.37 نقطة في أربعة تشغيلات. وفي معيار WorldMark، حل Odyssey‑3 أولاً في ثلاث من أصل أربع فئات، مسجلاً ما بين 76.3 و79.0 نقطة. كما عرضت الشركة النموذج وهو يتحكم بأذرع روبوتية وطائرات مسيّرة وشخصيات ألعاب، مدعية أنه أكثر موثوقية من الأنظمة المنافسة.
لماذا يهم
يتيح العرض المجاني للهواة والمطورين استكشاف عوالم ثلاثية الأبعاد مولّدة بالذكاء الاصطناعي بطريقة عملية، من دون الحاجة إلى وحدة معالجة رسومات متطورة. ويمكن للشركات التقدّم للحصول على واجهة API لتطوير نماذج أولية لمفاهيم في الروبوتات أو الذكاء الاصطناعي للألعاب، لكن ادعاءات النموذج بشأن نتائجه في المعايير لا تزال بحاجة إلى تحقق مستقل.