据彭博社9月7日报道,字节跳动正在基于其视频生成工具Seedance,开发一款实时空间视频生成模型。该项目的目标不只是生成一段视频,而是营造一个能随用户声音和动作变化的虚拟环境。报道称,字节跳动创始人张一鸣亲自协调跨部门团队和计算资源,产品最快可能在10月推出,但计划仍可能调整。应用方向包括直播、短剧和游戏,未来也计划用于Pico头显设备。

张一鸣2021年先后卸任字节跳动CEO和董事长,日常管理交给了梁汝波。此次他直接参与的是一个具体项目:把不同业务部门衔接起来,并投入AI算力资源。这款模型牵涉的环节较多,Seedance负责画面生成,云端提供计算能力,Pico处理用户交互,直播、短剧和游戏则是预期的落地场景。模型研究、基础设施和产品团队需要围绕同一项体验协作。
从生成内容到生成环境
与以往让用户观看生成好的视频不同,字节跳动这次希望用户能直接参与画面中的事件。这给技术带来了新的挑战:用户向前走或转身时,画面需要实时跟进并保持连续,系统还要对声音和动作作出回应。视角一旦没有事先安排,模型就必须应对种种不确定的变化。速度只是问题之一,前后画面能否衔接得连贯,同样决定体验是否成立。
Seedance已经用于CapCut、豆包等字节旗下产品,也进入了创作者和AI初创公司的工作流程,可以成为这项研发的起点。此外,有评论认为,抖音和TikTok积累的大量现实世界影像,对训练需要理解空间和运动的世界模型可能是一种优势,但素材多并不等于模型强,如何处理和运用训练数据仍需研发来解决。
另据科技媒体The Next Web转引36氪的报道,字节跳动为2026年设定了四项AI优先事项,世界模型排在首位,其余三项包括保持视频生成优势、提升编码能力以及推进豆包商业化。报道还提到,世界模型方向的数据预算达到八位数人民币,是其他中国竞争实验室的三到四倍;字节内部的目标是在2026年底前推出一款世界模型。当前开发的这一空间视频模型属于面向3D模拟、娱乐和游戏的路线,与另一条面向机器人的路线并行推进。









