据雷峰网9月1日报道,该媒体用一张《名侦探柯南》动画中陶罐破碎的截图作为参考图,要求MiniMax H3和Seedance 2.0 Fast两个视频生成模型反向生成“猫闯入工作室撞碎陶罐”的过程视频。实测结果显示,闭源商业模型Seedance 2.0 Fast在生成速度、写实质感和物理仿真稳定性上整体占优;开放权重的MiniMax H3虽能完成从结果到过程的叙事还原,但关键接触细节和音画准确性仍有差距。
报道称,测试在搭载英伟达RTX A6000 GPU的服务器上完成。MiniMax H3从魔塔社区下载模型权重,通过ComfyUI部署于本地;Seedance 2.0 Fast则通过云端闭源服务调用。两段视频均一次生成,没有重抽。Seedance 2.0 Fast生成一段10秒视频耗时3分23秒,按0.60元/秒计费,一段10秒视频需6元;MiniMax H3本地生成同类视频耗时54分4秒,费用主要来自电力、硬件折旧和等待时间。雷峰网指出,耗时差异不能简单等同于模型性能差距,本地GPU较老、推理环境和工程优化不足都可能拖慢H3。
在画面结果上,Seedance 2.0 Fast更接近实拍真实风格,镜头连续,能够交代从猫进入、靠近陶罐、被撞倒、坠地碎裂到碎片停稳的完整过程,陶罐重量感、坠落方向和碎片运动都有较强说服力。MiniMax H3则能按分镜逻辑建立“外力介入—陶罐坠落”的因果链,结尾保留参考图中的棕褐色陶土、浅色断裂边缘和低饱和动画风格,但整体仍偏动画化,猫与陶罐直接接触的瞬间没有清楚呈现,因而削弱了事故复现的可信度。
雷峰网分析,H3能完成这一任务,核心在于它是原生多模态生成模型,可将文本、图像、视频和音频放在同一框架处理,并支持参考图到视频/音频工作流;音画联合生成能让动作、声音在同一时间轴对齐。不过测试也发现,H3生成的视频开头声音与画面动作不完全匹配,且指令中要求猫在事故后从高窗逃离,模型未给出明确镜头。Seedance 2.0 Fast的猫动作更显刻意,缺少真实猫咪的随机性,物理链条虽完整,但动物行为自然度仍有违和感。
报道还提到,H3并非完整意义上的全栈开源,部分模块因系统复杂度较高尚未开放,官方提供API用于验证完整能力,本地开放权重版本与官方宣传效果之间可能存在差距。雷峰网认为,H3的意义在于为本地化、多模态视听生成和“结果反推过程”提供可研究起点,Seedance 2.0 Fast则体现了闭源商业模型在工程优化、写实质感和物理仿真上的成熟优势;视频模型要真正达到可靠的物理事故复原,仍需解决动作因果、受力逻辑、碎片运动和音画同步问题。