Oossa

SPW-Nav可根据语音指令实时生成2K全景视频

研究人员推出SPW-Nav模型,可从单张图片实时生成时长达一分钟的2K全景视频,并根据口头导航指令调整画面。

简讯作者: Oossa 发布日期: 1 分钟阅读

由Ziqi Cai带领的团队发布了SPW-Nav。这款流式全景世界模型能将语言指令转化为实时360度视频。它以一张全景图为起点,可按照“左转”或“向前走”等指令生成画面,同时保持较高的视频质量。系统采用球面旋转和与位姿对齐的条件控制,避免长时间生成时画面逐渐偏移。团队还发布了SPW-NavSet,这是一个包含全景视频、经核实的摄像机轨迹和指令的数据集。

为什么重要

这项技术有望让VR应用仅凭一张照片就能即时生成导览,减少对预录视频的依赖。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。