
作者 | 杨京丽
编辑 | 李水青
智东西 9 月 11 日报道,上个月,MiniMax 开源通用视频模型MiniMax H3。在第三方评测平台 Artificial Analysis 上,该模型一度登顶有声视频编辑榜榜首,Elo 得分达到 1130。凭借开放权重、视频生成质量和性价比,H3 很快在开发者社区内衍生出大量适配和新玩法。
模型开源解决了 " 能不能部署 " 的问题,但距离真正真正进入创作流程,中间还有一道速度门槛。对于需要反复调整画面的创作者来说,生成速度直接影响创作节奏。
针对这一痛点,RunningHub 近期推出并开源了 H3 视频生成加速方案H3 Lightning。在一组 5 秒视频生成对照测试中,RunningHub 将 H3 的生成耗时从 348.8 秒缩短至 28.7 秒,整体推理速度达到基础方案的约12 倍,等待时间减少约92%。
目前,相关技术方案和复现说明已经在 GitHub 公开。有多卡设备的用户可以参考方案进行本地部署,没有设备的普通创作者也可以直接在 RunningHub 上使用。

https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning
一、5 秒视频不到半分钟生成,等待时间减少 92%
H3 开源后迅速受到创作者关注,但实际部署后,一个问题随之显现:模型权重虽然可以下载,生成速度却依然影响使用体验。
在 RunningHub 的一组对照测试中,测试环境配备4 张 NVIDIA RTX 6000D专业显卡,生成一段 5 秒、1344 × 768 分辨率的视频。采用 BF16 基础方案,完成这一过程需要 50 步,耗时 348.8 秒,接近 6 分钟。
RunningHub 首先引入RH 后训练加速模型,将生成步数从 50 步压缩至 9 步,用更少的计算轮次完成视频生成。在这一配置下,生成耗时缩短至 60 秒,速度达到基础方案的5.8 倍。
在此基础上,RunningHub 进一步叠加算子和编译优化,将生成耗时继续压缩至28.7 秒。相较基础方案,整体推理速度提高约 12 倍,等待时间减少约 92%。
为验证这一能力,智东西也在 RunningHub 平台进行了测试,我们先让 H3 生成了一段5 秒的视频,内容是一只流浪猫吃猫粮,平台用时28 秒完成生成,整体过程较为流畅。
5 秒视频生成用时 28 秒(生成过程经倍速处理)
随后,我们提高测试难度:将视频时长增加到 15 秒,让模型生成一段发生在高级餐厅的都市短剧,角色变多、还加上了台词。

这段视频用时约 54 秒完成。视频中,一名身穿红裙、披着西装的女子带着两名保镖愤怒地冲进餐厅,宣布 " 在场的所有人,一个都不许走 ",现场气氛迅速变得紧张。实测来看,画面整体完成度较高,角色动作衔接自然,人物表情能够配合情节变化,台词、口型与画面基本匹配,声音也较为清晰,很有短剧的感觉。
除了文生视频,RunningHub 这套加速方案还可用于多参考图视频生成。在另一组测试中,RunningHub 使用8 张 RTX 6000D显卡,以 4 步生成 15 秒、768 × 1344 分辨率的竖屏视频。其中,文生视频耗时约48 秒,根据两张参考图生成视频耗时约73 秒。
值得注意的是,H3 Lightning 在提高速度的同时兼顾生成效果,仍保留 BF16 数值精度,且各项配置均经过组合测试和画质验收。
生成时长缩短,意味着创作者可以更快看到生成结果、调整提示词并尝试下一个版本。对于依赖反复迭代的 AI 视频创作,单次等待时间的缩短,最终会转化为整个创作流程效率的提升。
二、从 50 步压到 9 步,三层优化实现 12 倍提速
从近 6 分钟缩短至不到 30 秒,背后是一套覆盖模型计算和硬件协作的系统优化。
首先,视频生成需要经过多轮计算逐步形成画面,通常生成步数越多,耗费的时间越长。RH 后训练加速模型将对照测试的生成步数从 50 步压缩至 9 步,使耗时由 348.8 秒缩短至 60 秒,率先实现 5.8 倍提速。
减少生成步骤之后,RunningHub 继续提高剩余计算的执行效率。SageAttention2用于加快注意力计算,Cache-DiT通过缓存复用部分中间结果,减少后续步骤中的重复计算,torch.compile则对模型的计算流程进行编译优化,使其以更适合 GPU 的方式执行。
三项技术与 RH 后训练加速模型叠加后,5 秒视频的生成耗时由 60 秒进一步缩短至 28.7 秒,相较 BF16 基础方案实现约 12 倍的整体加速。
最后一层优化,是让多张显卡配合得更好。多卡视频生成不仅需要拆分计算任务,还需要在不同显卡之间交换数据。显卡之间如何分工,会直接影响生成速度、通信开销和显存占用。
针对主要通过 PCIe 连接、没有 NVLink 高速互联的多卡环境,RunningHub 选择了 TP2+Ulysses4 的并行组合。在 8 张 RTX 6000D 的测试中,这一组合相比 TP4+Ulysses2快约 12%,同时减少约 14GiB 显存占用。
RunningHub 将后训练加速、注意力优化、计算缓存、编译优化和多卡并行等方法统一整合进 SGLang 的 multimodal_gen 推理引擎,由同一套推理流程完成调度和执行。
三、适配 RTX 6000D 多卡环境,人人可用本地可部署
一套加速方案的实际价值,不只体现在跑得多快,也取决于它能落到什么样的硬件上,以及普通创作者能否真正用起来。
目前,不少视频生成加速方案多建立在 B300 等高端数据中心 GPU 上。此类硬件虽然性能强,但采购和部署门槛较高,普通工作室和创作者较难按照公开配置复现。
在上面测试中,RunningHub 采用 8 张 RTX 6000D 专业显卡,这些显卡主要通过 PCIe 连接,不依赖 NVLink 高速互联,就实现了生成速度的大幅提升,成本更低,更贴近工作室的硬件条件。
为了让本地部署更方便,RunningHub 在 GitHub 中提供了环境安装、模型下载、服务启动和推理测试步骤。有多卡设备的用户可以参考公开方案,在自己的服务器上部署 H3,并将模型接入已有的创作流程。没有多卡设备的普通创作者,也可以直接在 RunningHub 上使用,可以说是实现了人人可用,本地可部署。
这也不是 RunningHub 第一次参与 H3 开源生态建设。H3 上线后,RunningHub 先完成模型接入,随后开放全套 ComfyUI 节点,此次又进一步公开 H3 Lightning 加速方案。
据 RunningHub 披露,H3 上线以来,RunningHub 平台上已有上千名创作者开源近万条相关工作流,覆盖电商、短剧、漫剧、声音克隆、动作克隆和音频驱动等场景。节点、工作流和加速方案的持续开放,也为开发者进一步创作和开发提供了基础。

四、十年 GPU 调度积累,搭建 AI 产品矩阵
H3 Lightning 的推出,离不开 RunningHub 母公司海马云十余年的 GPU 工程积累。海马云成立于 2014 年,是一家覆以 GPUaaS 为底座,业务覆盖基础设施、模型服务和智能体应用的原生 AI 公司。
随着 AI 技术正从基础设施建设走向应用爆发和原生应用形成,行业关注的问题也从智能能否被规模化供给,转向这些智能如何被调用、如何被组织成真正能够完成任务的产品。在这一过程中,算力始终是支撑模型运行和应用落地的基础。
过去十余年,海马云围绕 GPU 容器调度、图形虚拟化和实时流媒体等环节进行技术投入,并在国内建设 60 余个边缘节点,为超过 3000 万月服务用户提供云渲染服务。在这一过程中,海马云积累了 GPU 资源调度、多任务并发和内容实时分发等工程能力,并逐步将这些能力延伸至 AI 推理。
在此基础上,海马云形成了从底层算力到上层应用的 AI 产品矩阵。其中,RunningHub 已面向全球 140 多个国家和地区提供服务,接入 170 余个模型 API;HaimaAPI 面向企业聚合 350 余个主流模型;RHTV、RHStory 和 VibeX 等智能体工具,则进一步将模型能力延伸到视频及其他内容生产环节。
海马云不直接训练基础模型,其重点是解决模型发布和开源之后的运行问题,包括新模型如何快速接入、如何在有限的硬件条件下提高推理效率,以及如何转化为创作者可以直接使用的产品。
具体到 H3,RunningHub 先完成模型接入,随后开放 ComfyUI 节点,再进一步公开 H3 Lightning 加速方案。这一过程也体现了海马云在发展过程中的能力演进:从解决高性能内容 " 怎么跑 ",到解决 AI 模型 " 怎么调用、怎么落地 "。H3 Lightning 正是其 GPU 工程能力在 AI 推理环节的一次具体应用。
结语:开源之后,推理优化成为视频生成提速的关键
模型开源,给了开发者自行部署、修改和二次开发的选择;推理优化,则进一步影响每次生成需要等待多久、消耗多少计算资源。当视频生成从尝鲜走向日常生产,生成质量之外,速度、稳定性、成本和部署条件,也会直接影响创作者的选择。
RunningHub 的 H3 Lightning,推进模型权重走向实际生产:有多卡设备的创作者可以参考公开方案本地部署,没有设备的创作者也可以在线使用。随着开源模型越来越多,推理加速、硬件适配和工作流生态,正在成为决定模型能否真正进入创作流程的关键环节。


登录后才可以发布评论哦
打开小程序可以发布评论哦