据爱范儿报道,生数科技近日发布实时视频生成与编辑模型 Vidu S2,包含 S2-Avatar 和 S2-Editing 两部分。该模型支持在视频流播放过程中驱动数字人并修改画面,输出分辨率提升至 720p,方向是把视频生成从离线制作推进到边播边改、持续接收指令的实时交互。

S2-Avatar 面向实时数字人互动,用户可上传照片、动漫形象或宠物图片创建数字角色,用语音或文本指令驱动摆臂、扭身、踏步、抬腿等动作,并提升了对舞蹈、手势和微表情的理解。直播中可依据参考图让角色持物、换服装和换背景。S2-Editing 面向流动视频,支持实时修改风格、服装、人物主体与背景,提供虚拟试穿、换背景、改风格和换角色能力。APPSO 评测称,上传服装参考图后可生成蓝色 POLO 衫、米色大衣、黑色皮衣与棒球服等上身效果,动作流畅度、面部稳定性和面料形变表现较好。

APPSO 在评测中创建乔布斯数字人,提供全身参考图并补充性格、表达方式及产品、设计、用户体验态度描述。被问“iPhone Duo 达到你的预期了吗”时,它回答“iPhone Duo 比我预想的流畅,但是价格让人犹豫”。评测者还让乔布斯跳舞,以测试全身动作控制与人物一致性;并与 Himari、30 多岁的美国送货司机 Tom Miller 视频通话,Himari 称自己穿的是校服,Tom Miller 回复“我正忙着送货”。

生数科技称,为减少长时间流式生成的崩溃与漂移,Vidu S2 采用 SRF 训练技术修正生成历史误差。模型使用 Backbone-Refiner 两阶段架构:主干网络以极低延迟负责骨架运动、物理规律和镜头语言推流,精炼网络异步完成 720P 细节重构、材质纹理与光影修复。临时参考图由基于视觉语言模型的 VLM Agent 协调,解析运动相位与空间状态并在毫秒级时间戳对齐特征;部署端针对因果流式生成进行强化学习,降低指令漂移率。该系统全链路研发由生数科技流式视频生成与推理负责人张金涛负责。

Vidu S2 面向实时对话、AI 情感陪伴、虚拟 IP、互动游戏、教育、文旅及直播等场景。实时生成或编辑后的画面可转换为同步左右眼视图,通过兼容头显呈现立体深度,已有立体视频也可实时编辑。张金涛在采访中称,未来大量视觉内容可能由 AI 实时生成,每个人都可以拥有独立交互会话。其他厂商中,Adobe 的 MotionStream 允许生成时用鼠标和滑块拖动镜头、改变物体轨迹,HeyGen 的 LiveAvatar 主打实时交互式 AI 数字人。据彭博社报道,字节也准备推出允许创建实时空间视频的 AI 模型,张一鸣正亲自监督开发,模型最快可能下个月面世。