字节准备推出实时空间视频AI模型,AI视频从“观看”走向交互

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:1.9w

摘要:字节跳动正准备推出一款实时空间视频生成AI模型,将Seedance的视频生成能力进一步延伸到可交互的三维虚拟环境。新模型瞄准直播、短剧和游戏,并计划与PICO头显结合,让虚拟世界随着用户的动作和语音实时变化。

产联社编辑 | 黄钰慧

image.png

【产联社】AI生成的视频,正在从一段只能从头看到尾的画面,变成一个人可以“走进去”的空间。9月7日,彭博社援引知情人士消息称,字节跳动正在准备推出一款实时空间视频生成AI模型。字节跳动创始人张一鸣正亲自督导新模型开发,协调公司内部多个业务部门,并调配AI资源和算力支持项目。新模型最快可能于10月推出,但具体发布时间尚未确定,相关计划仍可能调整。截至发稿,字节跳动尚未就相关报道作出回应。

这款新模型并非从零开始,而是建立在字节已经推出的视频生成模型Seedance之上。字节Seed团队今年2月发布的Seedance 2.0已经可以同时接收文本、图片、音频和视频等输入,并生成最长15秒的多镜头音视频内容。此次曝光的新模型则进一步从生成预先设定的视频,走向实时生成能够随用户操作变化的三维虚拟环境。

按照目前披露的方向,新模型将首先面向直播、短剧和游戏等场景,并尝试与PICO头显结合。字节此次布局的并不只是一款新的AI视频工具,而是在尝试让生成式视频进入实时交互场景。

从生成一段视频到实时生成一个空间

新模型最大的变化,是AI生成的内容不再在播放前就完全固定,而是可以随着人的操作继续变化。

目前的AI视频生成方式并不难理解。用户输入文字、图片或其他素材,模型生成一段视频,生成完成后,镜头和画面基本已经确定。字节的Seedance也是这一类视频生成模型。

实时空间视频则往前走了一步。据彭博社报道,字节的新模型计划让用户进入一个类似谷歌Genie的三维虚拟世界。以PICO头显为例,当用户说话或者做出动作时,模型可以根据这些输入继续生成相应画面,让虚拟环境作出响应,而不是只能观看一段已经制作完成的视频。

知情人士给出的目标参数也进一步体现了“实时”二字。模型可按需生成每秒20帧的视频,延迟约0.05秒,并用于空间计算环境和交互界面。不过,这些参数目前来自知情人士,并非字节正式发布后的产品指标。

这也是它被归入“世界模型”探索的原因之一。与生成固定内容不同,这类模型试图模拟一个能够持续变化和交互的环境。对普通用户而言,可以理解为,过去是让AI“拍一段给你看”,现在则希望用户进入之后,AI还能根据操作继续生成后续画面。

直播、短剧和游戏先成为落点

比“世界模型”这个概念更具体的是,字节已经为新模型划出了直播、短剧和游戏三个应用方向。

据知情人士透露,新模型将允许用户为这些场景创建可交互的虚拟世界。相比普通视频,这三个方向也更容易体现实时空间生成的差异。

对于直播和短剧,核心变化是内容不再完全由预先拍摄的镜头决定。虚拟环境如果能够实时生成,用户就有机会从单向观看转向参与和互动。不过,目前披露的信息只明确了直播和短剧等应用方向,具体产品形态和互动方式尚未公布。游戏则是更直接的落点。游戏本身就是由空间、角色和用户操作组成的交互环境。如果模型能够根据操作持续生成环境,AI生成内容就不再只用于制作素材,而开始进入用户实际体验内容的过程。

这三个场景指向同一种变化,AI视频正在尝试从“内容制作工具”,进入内容运行和交互的过程。对字节而言,这次升级的重点已经不只是提高视频生成质量,而是让生成内容进一步具备实时性和空间交互能力。

PICO可能成为空间模型的硬件入口

如果直播、短剧和游戏解决的是这些内容可以用在哪里,PICO解决的则是用户如何真正进入这些虚拟空间。

按照知情人士透露的规划,新模型将生成能够响应PICO头显用户语音和动作的虚拟世界。张一鸣还希望以空间视频模型为支点,将字节的AI模型、云计算资源、内容平台以及PICO硬件连接起来。

生成三维空间需要大量计算,字节正在探索把生成空间内容所需的大量计算转移至云端,从而降低头显对本地处理能力的要求,并为成本更低、配置更简单的VR设备创造可行路径。

如果大量空间内容未来能够由云端AI实时生成,XR竞争的关注点也可能从单纯比拼硬件规格,进一步扩展到AI模型、计算基础设施和内容分发平台。

这恰好覆盖了字节目前拥有的多项资源。Seedance提供视频生成技术,云计算资源承担模型运行,内容平台提供应用入口,PICO则承担人与虚拟环境之间的硬件交互。

不过,目前还不能把这套组合写成已经形成的产品闭环。新模型尚未正式发布,PICO将如何接入、哪些内容平台率先采用、云端运行成本如何解决,都还没有明确答案。

世界模型开始寻找真实产品入口

字节加入之后,世界模型的竞争正在从模型本身,进一步延伸到游戏、内容创作和XR等实际产品场景。

谷歌已经在探索类似方向。彭博社将字节新模型与谷歌Genie进行比较,两者都尝试通过视频生成构建能够实时互动的虚拟环境,并进一步用于模拟AI智能体所处的物理世界。

不同的是,字节此次曝光的应用入口明显集中在自身已有的视频内容和XR业务上。这让世界模型不再只停留在模型能力层面,而开始更直接地进入内容生产、游戏互动和硬件终端等真实产品场景。

从竞争关系看,字节面对的不只是谷歌。Meta已经围绕Quest建设VR生态,苹果则将Vision Pro定位为空间计算平台。如果字节的新模型最终落地,快速生成内容的能力可能让XR竞争进一步从硬件规格延伸到AI模型、计算基础设施和内容分发平台。

但字节此次曝光的路线,与单纯继续提高头显硬件性能有所不同。它试图把更多空间内容的生产放到AI模型和云端,再通过PICO把这些内容送到用户眼前。

目前,这条路线距离真正落地仍有不少问题待回答。新模型尚未正式推出,20fps和0.05秒延迟仍是知情人士透露的目标表现,云端实时生成的成本、规模化稳定性以及具体产品形态都有待确认。但字节的视频AI路线已出现更清晰的延伸方向,从Seedance生成一段视频,走向实时生成一个可交互的空间。真正需要验证的,是这项能力能否接入直播、短剧、游戏和PICO,把视频生成从内容制作工具变成内容交互方式。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

386
198
分享
上一篇 下一篇