萌壹菌 5小时前
MiniMax H3 开源炸场!本地跑带音视频模型时代来了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 31 日,MiniMax 正式推出新一代视频生成模型 H3,它跳出了传统 AI 视频工具只靠提示词生成画面的局限,是一款真正意义上的通用多模态视频大模型。

和以往模型后期拼接音频不同,H3 可以原生输出双声道立体声视频,把文本、图片、视频、音频全部当成输入上下文统一解读,理解各类素材之间的关联,直接输出音画同步的完整成片。

8 月 3 日官方直接放出开源权重,一经放出就在开发者圈子掀起不小反响,不少玩家把这次事件称作开源视频领域的 "DeepSeek 时刻 "。

过去高质量 AI 视频基本被闭源方案牢牢把持,想要出片就得按秒花钱充值点数。MiniMax H3 开源之后,普通用户可以直接把模型部署在自己电脑本地,依靠显卡算力完成生成,不再需要持续消耗云端积分。更让人惊喜的是它的硬件门槛放得很低,8GB 显存显卡就能够跑通基础的视频生成,大大降低普通玩家上手多模态视频生成的门槛。

开源首日 ComfyUI 就快速完成适配,官方配套三套现成工作流:文生视频、首尾帧图生视频,还有自由度最高的多参考生视频。多参考模式最多支持 12 份参考素材,其中图片最多 9 张,视频、音频各 3 条;单份音视频素材控制在 2 ‑ 15 秒,全部参考素材总时长不能超过 15 秒。但也要客观看到,导入的参考素材数量越多,显卡压力会明显上涨,生成耗时也会跟着拉长。

输出方面,本地版本生成视频时长区间为 4 ‑ 15 秒,默认短边 768 像素;2K 高分辨率生成则需要使用官方云端接口。想要本地拿到高清成片,更务实的做法是先生成默认分辨率素材,再借助超分工具提升清晰度。视频时长拉得越长、分辨率调得越高,显存、内存的消耗会呈明显上升,低配显卡直接硬跑高规格参数很容易出现报错、生成失败。

不少玩家拿闭源 Seedance 2.5 和本地部署的 H3 做过对照测试,用同一张参考图生成角色形象。Seedance 2.5 生成出来的人物会更加贴合原始设定,但每秒需要付出 1.3 元的调用成本;MiniMax H3 本地生成角色偏差控制同样不错,零点数成本,二者各有取舍。

当然 H3 本地部署并不是毫无门槛,显存依旧是绕不开的硬约束。8GB 只能勉强体验,想要流畅体验,低显存显卡要搭配量化、裁剪版模型,再叠加加速 LoRA 插件降低硬件压力。新一代 RTX50 系 Blackwell 架构显卡还支持 FP4 特殊优化,对 H3 做了针对性适配。综合大量玩家实测反馈,12GB 显存是勉强可用的起步,16GB 显存才是体验 H3 绝大部分能力的甜点配置

总的来说,MiniMax H3 的开源,直接把多模态音视频生成从付费云端,带到普通消费级 PC 设备上。虽然本地生成速度比不上云端,2K 能力依旧依赖官方接口,但它已经实实在在拓宽了普通创作者的玩法边界。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 分辨率 ai 考生
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论