California merkezli yapay zekâ girişimi Odyssey, dünya modeli Odyssey‑3’ün herkese açık araştırma önizlemesini kullanıma açtı. Herkes, metin açıklamalarından etkileşimli ortamlar oluşturan ve kullanıcıların bu ortamlarda birinci ya da üçüncü şahıs görünümünde hareket etmesini sağlayan ücretsiz çevrimiçi demoyu deneyebilir. Geliştiriciler de modeli kendi projelerine entegre etmek için API erişimine başvurabilir.
Model neler yapabiliyor?
Odyssey‑3, her kareyi önceki kareden ve kullanıcı eylemlerinden yola çıkarak tahmin eden bir yapay zekâ türü olan otoregresif difüzyon transformatörünü kullanarak gerçek zamanlı video kareleri oluşturuyor. Temel model 14 milyar parametreye sahip ve 832 × 480 piksel çözünürlükte video üretiyor; daha üst seviye Odyssey‑3 Pro ise 1280 × 720 piksel çözünürlükte çalışıyor. Şirket, modelin neden-sonuç ilişkilerini internet videolarından, girdi kayıtları içeren oyun görüntülerinden ve simüle edilmiş fizik sahnelerinden öğrendiğini söylüyor.
Kıyaslamalar ve ilk testler
Odyssey, video-videoya dönüştürme kıyaslaması Physics‑IQ Verified’da 66.1 puanla en yüksek skoru aldığını bildiriyor. Ancak bu rekor, kıyaslamanın standart kurallarına uymayan bir seçim adımı içeren tek bir çalıştırmadan elde edildi. Bu adım olmadan model, dört çalıştırmada ortalama 63.37 puan aldı. WorldMark kıyaslamasında Odyssey‑3, dört kategorinin üçünde ilk sırada yer alarak 76.3 ile 79.0 arasında puanlar elde etti. Şirket ayrıca modelin robot kolları, dronları ve oyun karakterlerini kontrol ettiği demolar gösterdi ve rakip sistemlerden daha güvenilir olduğunu öne sürdü.
Neden önemli
Meraklılar ve geliştiriciler, ücretsiz demo sayesinde üst düzey bir GPU’ya ihtiyaç duymadan yapay zekâyla oluşturulan 3B dünyaları deneyimleyebilir. Şirketler, robotik veya oyun yapay zekâsı fikirlerinin ilk prototiplerini geliştirmek için API erişimine başvurabilir; ancak modelin kıyaslama sonuçlarına ilişkin iddialarının bağımsız olarak doğrulanması gerekiyor.