叮当当科技 8小时前
MiniMax H3提速12倍,不堆卡用三刀工程优化时间
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

MiniMax H3 刚开源就被各路开发者玩出了花。一站式创作平台 RunningHub 盯上了一个痛点:让 H3 跑快点。

15 秒视频,50 秒出片

开源模型火了,大家最直观的感受就是 " 等 "。

模型越好,创意越容易一秒钟变十个,结果屏幕上的进度条还在缓慢爬升。灵感一旦断了,后面的视频就懒得剪了。

RunningHub 的 H3 Lightning 方案,就是冲着这个等待时间去的。

在 4 张 RTX 6000D 的环境下,原始 BF16 50 步方案生成一个 5 秒、1344 × 768 的视频,耗时 348.8 秒,差不多是 6 分钟。

RunningHub 跑完同样的任务,只需要 28.7 秒。

图 · H3 Lightning 提速效果

前后约 12 倍提速,生成耗时减少了 92%,关键是还保留了 BF16 的满血数值精度。没有走降精度换速度的捷径。

2026-09

MiniMax H3 开源

RunningHub 发布 H3 Lightning 加速方案

不只是 5 秒视频,15 秒长视频提速更明显。

在 8 张 RTX 6000D 环境下,生成一个 15 秒、分辨率 768 × 1344 的视频:纯文字生成大约需要 48 秒,双参考图生成约 73 秒。

这意味着,一条 15 秒的图生视频,直接被打进了 "1 分钟出结果 " 的时间尺度。

人、车、沙尘的运动逻辑连贯,落地时车身有明显的下沉和回弹。

硬件环境 4 张 RTX 6000D

原始耗时 348.8 秒(约 6 分钟)

优化后耗时 28.7 秒

提速倍数约 12 倍

精度保持 BF16 满血精度

图 · 吹爆开源!RunningHub 让 MiniMax

三刀工程优化

不降精度,不开挂顶级算力,RunningHub 把时间是从哪儿抠出来的?

它沿着推理链路下了三刀。

第一刀,先让模型少算一点。

视频生成不是看一眼提示词就出结果的,它需要一轮一轮把画面从噪声中 " 想 " 出来,这个轮次叫生成步数。原始 H3 推理默认 50 步,每一步都要实打实跑一遍计算。

RunningHub 引入了自研的 RH 后训练加速模型。简单说,就是让 H3 学会用更少的步数把视频做出来,还不丢画质。

同样在 4 张 RTX 6000D 上生成 5 秒视频,换成 RH 后训练加速模型的 9 步测试方案后,时间直接缩短到了 43 秒。第一刀下去,已经提速了 8 倍。

RunningHub 推荐配置默认是 4 步;遇到快速运动、大幅动作这类难任务,可以切到 8 步。快还是稳,创作者自己定。

图 · H3 Lightning 三刀优化路径

43 秒虽然猛了,但 RunningHub 还嫌慢。

第二刀往执行层砍。

一口气上了三个技术组合:SageAttention2、Cache-DiT 和 torch.compile。

SageAttention2 盯的是注意力计算。视频模型处理画面元素关系时,这一步最吃算力。

Cache-DiT 盯的是重复劳动。视频生成前后多个步骤存在可以复用的信息,能缓存的缓存,能复用的复用。

torch.compile 对计算过程进行编译优化,减少零散的调度和执行开销。

这三件套叠在一起,把 43 秒压到了 28.7 秒。

第三刀,解决多卡之间的互相等待。

GPU 多了不等于一定快。没有 NVLink 高速互联、主要靠 PCIe 通信时,卡间交换数据的成本很高。

RunningHub 在 8 张 RTX 6000D、PCIe 连接且没有 NVLink 的环境下,重新测试了多卡并行方式。最后选中的组合是 TP2+Ulysses4。

相比 TP4+Ulysses2,这个组合速度快约 12%,同时减少约 14GiB 显存占用。

本地部署的最后一公里

这套方案最终整合进了 SGLang multimodal_gen 推理引擎。

真正稀缺的不是开源模型,而是谁能把模型接入真实环境,优化到生产可用。

RunningHub 绕开了对超算中心顶级算力的依赖,专门针对无 NVLink 的 PCIe 多卡环境优化。RTX 6000D 是公开可购买的专业 GPU 规格。

从环境安装、模型下载,到服务启动和推理测试,H3 Lightning 整个本地部署流程都开源了。

开发者也可以结合公开的社区加速 LoRA,在自己的机器上重新跑一遍。到底要几张卡、怎么调参数、速度和画质怎么取舍,都可以围绕业务适配。

推荐配置 4 步(默认)/ 8 步(复杂动作)

多卡组合 TP2+Ulysses4

显存节省相比 TP4+Ulysses2 省 14GiB

通信环境无 NVLink 的 PCIe 环境

开源地址 GitHub ( MiniMax-H3-MultiGPU-Lightning )

不想自己部署的创作者,直接在 RunningHub 上点开 H3 Lightning 也能用。

不跨界,是十年技术积累

从 AIGC 平台的角度看,RunningHub 跑去研究后训练、算子优化和多卡并行,多少有点跨界。

但如果放到母公司海马云过去十多年的技术演进里,这事儿顺理成章。

海马云 2014 年成立,过去十多年长期和 GPU、高性能内容打交道。

早期的核心矛盾是游戏、图形、高性能数字内容体量越来越大,如何让这些负载稳定、高速地运行起来。GPU 容器调度、图形虚拟化、实时流媒体、大规模云渲染,整套能力体系都是围绕这个目标打磨的。

如今,海马云在国内建设了 60 余个边缘节点,支撑超过 2000 万月活用户的智算服务。

计算对象从云渲染变成了 AI 推理,但底层技术是相通的。RunningHub H3 Lightning 是海马云 GPU 工程能力在 AI 时代的一个新落点,补齐了开源模型从权重到生产力之间缺失的环节。

H3 刚开源时,RunningHub 第一时间接入,并开源了全套 ComfyUI 节点。

围绕 H3 已经诞生了上千名创作者,近万条创意工作流。有人做电商视频,有人做短剧漫剧,有人研究声音克隆。

图 · 海马云的 AI 技术演进

一个人解决一点问题,整个生态能用的东西就越来越多。

母公司名称海马云

成立时间 2014 年

边缘节点 60 余个

月活用户超 2000 万

核心技术 GPU 容器调度、图形虚拟化、云渲染

量子位实测,在 15 秒图生视频(吉卜力风格参考图)中,从点击到出片大概 88 秒。从坐着到起身,再到迈步加速,动作衔接自然。金毛也没有变成跟着人物平移的贴纸,自己完成了起身、奔跑和跳跃。

如果预算没上限,用 B300 的卡配合这个方式,出片速度能直接提升至秒级。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 分辨率 效果 不降
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论