APPSO 观看国内首场 AI 艺人线下演唱会后提到,主角 Yuri 尤栗只能在大屏幕上打字互动,若能实时点歌或玩小游戏会更有趣。现在,生数科技发布的 Vidu S2 把视频生成推向实时操控,分为 S2-Avatar 和 S2-Editing。前者面向实时数字人互动,支持 720p 输出,增强动作指令遵循与表演能力,直播中可输入参考图并按指令持物、换装、换背景;后者面向流动视频画面,可实时修改风格、服装、人物主体和背景,用于直播、虚拟演绎和互动内容。

APPSO 评测显示,S2-Avatar 对舞蹈、特定手势和情绪微表情的理解提升,语音或文本指令可驱动摆臂、扭身、踏步、抬腿等动作。上传真人照片、动漫形象或宠物图片即可创建数字人物;开启麦克风和摄像头权限后,可与其对话,并在视频流任意时刻加入物品、服装或背景图片,输出分辨率同步为 720p。
在 iPhone 首款折叠屏手机引发讨论时,APPSO 在 Vidu S2 里创建了乔布斯数字人:用一张全身参考图,加上性格、表达方式及对产品、设计和用户体验的态度等描述。评测关注它不能只长得像,交流和行为也要维持角色。问“iPhone Duo 达到你的预期了吗?”,它回答:“iPhone Duo 比我预想的流畅,但是价格让人犹豫。”之后还让乔布斯跳舞,测试全身动作控制。Vidu S2 不只是让照片动起来,而是把固定人物形象变成能拿东西、评价东西,甚至完成复杂动作的数字角色。
体验中还与 Himari 和 Tom Miller 视频通话:输入“介绍下你的穿搭”,Himari 说自己穿的是校服;问 Tom Miller 在做什么,他回复“我正忙着送货”。为处理长时间流式生成中的崩溃与漂移,生数科技独创 SRF(Self-Replay Forcing)训练技术,让模型拥有自我纠错记忆并修正误差。Vidu S2-Editing 只需一张参考图,即可实时编辑正在播放的视频流。










