据量子位报道,生数科技9月16日发布视频生成模型Vidu S2,该模型包含S2-Avatar与S2-Editing两个细分模型,支持数字人实时互动和正在播放视频的实时编辑,并探索实时空间视频。Vidu S2发布当天全量开放,不设内测和名额限制。

S2-Avatar是实时交互模型,支持语音对话、语音控制数字人做动作,以及实时交互中输入参考图。与上一代Vidu S1相比,S2-Avatar将实时输出分辨率从540p提升至720p,数字角色面部和服装细节更丰富,并能执行更大肢体动作。报道中的对比测试显示,同样要求数字人跳舞、转圈和跺脚,S1未能完成,S2则按指令动起来。用户在互动过程中递入新图片后,数字人可拿起图中物品、换上指定衣服或进入新场景。

S2-Editing是实时视频编辑模型,提供实时人物换装、更换背景、更换主体角色和实时风格渲染四类能力。报道展示的案例中,受访女士可被切换多套服装,动作连贯且脸部一致性较好,服装随动作产生形变;但第二套衣服在呈现色块时仍有涂抹感,人物戴帽时头发有轻微穿模。该模型还可将背景替换为不同场景,或将办公室中的人物替换为牛等形象,并完成风格迁移。量子位称,这意味着直播间视觉效果、虚拟角色演出和创意视频有了更多临场发挥空间。

Vidu S1在约69天前发布,当时让AI视频从离线生成进入实时交互,仅需上传一张照片即可生成可实时互动的AI角色。Vidu S1、Vidu S2的全链路研发由清华大学朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。实时交互视频的每一帧根据用户输入现场计算,生成速度必须跑赢播放速度,团队用SageAttention等技术提速,并通过多GPU协同调度减少模块等待。

在空间视频方面,Vidu S2可将生成或编辑的视频转换为左右眼画面并送入VR头显。用户可把普通视频实时转成空间视频,也可将头显摄像头看到的物理世界当作“画布”创作。团队表示,头显对分辨率和延迟要求极高,画面模糊会致晕,延迟高会导致转头与画面不同步,该方向仍在持续优化;未来计划从固定视角扩展到全景空间视频。

技术实现上,Vidu S2在数据层面补充舞蹈、二维动画和三维动画等训练素材,并按事件顺序标注动作、变化和状态。流式训练采用Hybrid Forcing和Self-Replay Forcing,让模型在生成中接住自身偏差。模型采用Backbone-Refiner两阶段架构,Backbone生成主体结构、运动和语义,Refiner生成细节,异步流水线让细节重建与后续内容生成并行,以在720P输出下不掉帧。换装和换背景依赖时间戳对齐,模型将参考图注入位置与时间戳对齐,使新条件从指定时间点生效。VLM Agent持续解析画面状态并规划后续生成,强化学习则在双向和流式阶段分别采用DPO与Streaming NFT优化画质、动作可控性和指令遵循。

据量子位报道,Vidu S2的体验入口为vidu.cn/vidu-stream,API平台为platform.vidu.cn/vidu-stream/doc,技术报告已发布在arXiv。