加州AI初创公司Odyssey已开放其世界模型Odyssey‑3的公开研究预览版。任何人都可以免费试用在线演示,输入文字描述即可生成可交互环境,并以第一人称或第三人称视角移动。开发者也可以申请API访问权限,将模型集成到自己的项目中。
模型能做什么
Odyssey‑3采用自回归扩散Transformer实时生成视频帧。这类AI会根据前一帧和用户操作预测下一帧。基础版模型拥有14 billion个参数,可生成832 × 480像素的视频;更高阶的Odyssey‑3 Pro则支持1280 × 720像素。该公司表示,模型通过互联网视频、带有操作记录的游戏画面以及模拟物理场景学习因果关系。
基准测试与早期试用
Odyssey表示,模型在Physics‑IQ Verified视频到视频基准测试中最高得分为66.1分。不过,这一纪录来自单次测试,且采用了不符合该基准标准规则的筛选步骤。若不进行这一步,模型四次测试的平均得分为63.37分。在WorldMark基准测试中,Odyssey‑3在四个类别中的三个排名第一,得分介于76.3至79.0分之间。该公司还演示了模型控制机械臂、无人机和游戏角色,并称其可靠性优于竞品系统。
为什么重要
对于爱好者和开发者来说,免费演示提供了亲自体验AI生成3D世界的机会,无需高端GPU。企业可以申请API访问权限,试做机器人或游戏AI原型;不过,模型的基准测试成绩仍有待独立验证。