カリフォルニア州のAIスタートアップ、Odysseyは、世界モデル「Odyssey‑3」の一般向け研究プレビューを公開した。誰でも無料のオンラインデモを試せる。テキストで説明した環境を生成し、一人称または三人称視点で移動できる。開発者はAPI利用を申請し、自身のプロジェクトにモデルを組み込むことも可能だ。
モデルでできること
Odyssey‑3は自己回帰型拡散トランスフォーマーを使い、リアルタイムで映像フレームを生成する。これは、直前のフレームとユーザーの操作をもとに次のフレームを予測するタイプのAIだ。ベースモデルのパラメーター数は14 billionで、832 × 480ピクセルの動画を出力する。上位版のOdyssey‑3 Proは1280 × 720ピクセルで動作する。同社によると、このモデルはインターネット上の動画、操作ログ付きのゲーム映像、物理演算を用いたシミュレーション映像から因果関係を学習する。
ベンチマークと初期テスト
Odysseyによると、動画から動画を生成するベンチマーク「Physics‑IQ Verified」で最高66.1ポイントを記録した。ただし、この記録は1回の実行によるもので、選別工程も含まれており、ベンチマークの標準ルールには準拠していない。その工程を使わない場合、4回の実行で平均63.37ポイントだった。「WorldMark」ベンチマークでは、Odyssey‑3は4カテゴリー中3カテゴリーで首位となり、76.3~79.0ポイントを獲得した。また同社は、ロボットアームやドローン、ゲームキャラクターをモデルで操作するデモを披露し、競合システムよりも高い信頼性を実現したと主張している。
なぜ重要か
趣味で試す人や開発者は、高性能GPUがなくても無料デモでAIが生成する3D世界を体験できる。企業はAPI利用を申請し、ロボット工学やゲームAIのアイデアを試作できるが、ベンチマークに関する主張は独立した検証を待つ必要がある。