生成一段 14.4 秒的 768p 视频,端到端只需要 9.0 秒。这个数字来自 MiniMax H3 在 8 × B200 上的最新实测——预热完成后,去噪速度已经超过实时的 2 倍。
更细的拆解是:8 步去噪本身只花6.9 秒,9.0 秒覆盖的是整个生成请求的完整链路。对比对象是稠密 50 步的 H3,官方给出的说法是没有测到质量回退。

提速是怎么来的
这次提速不是单一环节的优化,而是两个开源项目的叠加:SGLang-Diffusion 加上 VDN-H3。前者负责推理调度,后者负责把去噪步数压下来。
把 50 步压到 8 步,是速度翻倍的关键变量。步数减少意味着模型前向次数大幅下降,而质量是否守住,是这类加速方案最容易被质疑的地方。这次给出的结论是 " 没有测到质量回退 " ——注意是 " 没有测到 ",不是 " 绝对无损 "。
另一个变量是硬件。8 × B200 的配置本身就属于高规格推理环境,2 倍实时这个成绩是在这个前提下取得的,不是消费级显卡上的表现。
几个值得记住的数字
14.4 秒:生成的 768p 视频时长
9.0 秒:预热后的端到端生成耗时
6.9 秒:8 步去噪耗时
2 倍以上:相对实时的去噪速度
8 × B200:测试所用硬件配置
这几个数字放在一起看,意义在于视频生成的时间成本结构正在变化。当生成一段十几秒的视频只需要个位数秒数,交互方式和使用场景都会跟着变。
开源生态的复利
这次提速的路径很清晰:MiniMax H3 作为模型,SGLang 作为推理框架,VDN-H3 作为加速方案,三者都是开放可组合的。发布方的表述是 " 开放模型通过开放生态实现复利 "。
这句话背后的逻辑不难理解。模型方把权重放出来,推理框架方去做调度优化,加速方案方去压步数,每一层都能被其他人接着改。速度的提升不是某一家闭门做出来的,而是多个项目互相叠加的结果。
对使用者来说,这意味着拿到的不只是一个更快的模型,而是一套可以被继续优化的组合。今天跑出 2 倍实时,明天可能有人在这个基础上再往前推一步。
当然,所有成绩都有前提。8 × B200 不是普通配置,9.0 秒是预热后的数字,质量结论是 " 没有测到回退 "。这些限定条件本身就是信息的一部分。


登录后才可以发布评论哦
打开小程序可以发布评论哦