【CNMO 科技消息】据 CNMO 科技了解,MiniMax 近日正式开源多模态生成模型 MiniMax H3。与此同时,摩尔线程宣布,已基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈,完成对 MiniMax H3 的适配与运行。

MiniMax
MiniMax H3 是一套通用型全模态生成系统,可统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。此次开源内容包括模型权重,同时提供本地部署和完整工作流验证方案。

MiniMax H3
从架构来看,H3 系统由三个核心模块组成。其中,H3-Context-IR 负责理解并提炼用户输入的多模态指令,将其转换为结构化的上下文中间表示,目前通过 API 提供;H3-Base 根据中间表示生成 768p 分辨率音视频内容,是此次开源主体;H3-Regenerate-2K 则将 768p 结果与原始上下文一同送回模型,以 2K 分辨率重新生成更高画质视频,该模块暂未开源,也通过 API 提供。
在模型设计上,H3-Base 采用 330 亿参数的 H3-Omni-Transformer 架构,通过不同模态编码器将文本、图像、视频和音频统一编码为多模态序列后进行联合预测。其下包含 H3-VisualVAE 和 H3-AudioVAE,分别用于视觉和音频信息压缩。官方同时提供两个主要版本,分别面向文生视频、首尾帧生视频,以及多图像、多视频、多音频混合输入等任务,适用于人物与场景保留、动作和嘴型编辑等场景,并支持包括中文、英语、日语、韩语在内的 11 种语言对话。
为方便开发者部署,官方给出 "H3-Base 本地部署 " 和 " 完整 2K 工作流 " 两条验证路径,支持通过 SGLang、vLLM、diffusers、ComfyUI 等框架进行推理。模型目前基于 MiniMax H3 Community License 发布,开发者可通过开源平台下载使用。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦