据量子位报道,一站式AIGC创作平台RunningHub已将其针对MiniMax H3视频生成模型的加速方案H3 Lightning在GitHub开源。该方案面向本地多卡部署,在4张RTX 6000D上生成5秒、1344×768视频,原始BF16 50步方案耗时348.8秒,H3 Lightning完整加速后为28.7秒,前后约12倍提速,生成耗时减少约92%,并保留BF16数值精度。

据量子位报道,在8张RTX 6000D环境下,H3 Lightning生成15秒、768×1344视频,纯文字生成约48秒,双参考图生成约73秒。该报道称,其测试中5秒文生视频实际用时约30秒,15秒图生视频从点击到出片约88秒,二次创作约50秒。RunningHub推荐配置为默认4步,遇到快速运动、大幅动作等难任务可切到8步。

RunningHub将提速归因于三个层面的工程优化。首先在模型层引入自研RH后训练加速模型,使H3用更少生成步数完成视频制作。原始H3推理默认50步,换成9步测试方案后,在4张RTX 6000D上生成5秒视频的时间缩短至43秒,该环节已实现约8倍提速。

其次在执行层,RunningHub组合使用SageAttention2、Cache-DiT和torch.compile。SageAttention2针对注意力计算,Cache-DiT复用视频生成步骤间的中间结果,torch.compile优化计算调度和执行开销。与RH后训练加速模型叠加后,前述生成过程从43秒进一步压至28.7秒。

多卡层面,RunningHub在不依赖NVLink、主要依靠PCIe通信的环境中重新测试多卡并行方式,最终选择TP2+Ulysses4组合。据量子位报道,在8张RTX 6000D、PCIe连接且没有NVLink的环境下,TP2+Ulysses4相比TP4+Ulysses2速度快约12%,同时减少约14GiB显存占用。RunningHub将这些方法整合进SGLang multimodal_gen推理引擎。

RunningHub称,H3 Lightning针对的是无NVLink的PCIe多卡环境,RTX 6000D也是公开可购买的专业GPU规格。整个本地部署流程从环境安装、模型下载到服务启动和推理测试均已公开。有设备的团队可照开源方案自行部署,没有多卡服务器或不希望研究环境配置的创作者,可直接在RunningHub上使用H3 Lightning。报道还提到,若使用B300显卡,出片速度可提升至秒级。

在生态方面,MiniMax H3开源后,RunningHub先接入模型,随后开源全套ComfyUI节点。据该报道,H3上线以来,RunningHub平台上已有上千名创作者围绕其开源近万条创意工作流,涵盖电商内容、短剧、漫剧、声音克隆、动作克隆和音频驱动等方向。有创作者发布电商多参生视频工作流,也有创作者制作音频驱动数字人说话唱歌工作流和漫剧成片工作流。