据机器之心报道,清华大学与香港科技大学研究团队提出实时流式视频编辑框架LiveEdit,能够在4步去噪条件下以12.66 FPS的速度处理持续输入的视频,完成文本指令驱动的编辑。该工作已被计算机视觉顶级会议ECCV 2026接收,训练、测试代码和模型均已开源。

流式视频编辑与常规视频生成不同,需要在修改目标区域的同时保持原始视频的结构、背景和运动。现有高质量视频扩散模型依赖双向时空注意力,必须等待未来帧到齐才能处理,难以满足低延迟和持续输出的要求。LiveEdit采用因果、分块的方式处理视频流,每个视频块只能访问当前和历史内容。

为实现实时编辑,LiveEdit设计了渐进式三阶段蒸馏流程,基础模型为Wan2.1-T2V-1.3B,训练数据筛选自Ditto-1M数据集中的两万组高质量视频编辑对。第一阶段保留完整双向DiT结构,学习稳定的编辑先验;第二阶段引入块状因果注意力,通过教师强制将双向模型的局部时序先验迁移到单向因果模型;第三阶段使用分布匹配蒸馏,将推理步数从100次压缩至4次,并移除分类器自由引导。

为解决未编辑区域重复计算问题,LiveEdit提出面向自回归的掩码缓存机制。通过比较前一个视频块的原始视频与编辑结果差异,预测当前块的编辑区域掩码,仅对活跃编辑Token执行完整计算,未编辑Token复用缓存的中间特征。在默认推理配置下,约70%的冗余空间Token被裁剪。缓存位置经过消融实验,选择在Self-Attention层复用特征,避免FFN高频信息复用导致画面模糊。

效率测试中,LiveEdit处理81帧视频的总延迟为7.89秒,达到12.66 FPS。研究团队建立120组样本的测试集,从文本对齐度、背景一致性、运动平滑度等维度比较,结果显示LiveEdit能准确完成局部颜色、材质替换,并减少向非编辑区域漂移。用户研究中,20名志愿者对指令一致性、背景保留和整体质量排序,LiveEdit的Top-3偏好率分别达到100%、87.5%和95.8%。

该框架为直播特效、视频会议、实时内容创作等在线交互场景提供了技术基础。不过,当前方法依赖相邻视频块编辑区域稳定的假设,目标快速移动或大范围修改时,掩码估计与缓存策略仍有优化空间。如何在更长视频、更高分辨率和复杂指令下保持稳定,是后续研究方向。