
作者 | 杨京丽
编辑 | 李水青
智东西 7 月 31 日报道,今日,MiniMax 发布通用全模态生成模型MiniMax H3。该模型能够统一理解文本、图像、视频和声音,并生成带原生双声道的音视频,最高支持15 秒、2K 分辨率输出。
MiniMax 称,该模型在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面表现出色,可用于广告、品牌、电商、产品设计、UI/UX 和游戏等场景。
价格方面,MiniMax 称其有能力提供行业内最优的性价比,模型在 2K 分辨率下每秒价格不到主流模型的1/3,768P 分辨率下不到1/2,具体价格暂未公布。
目前,MiniMax H3 在第三方评测机构 Artificial Analysis 的文生视频有声榜单中排名第二,Elo 得分为 1242 分,略低于谷歌 Gemini Omni Flash 的 1245 分。

一、文本、图片、视频、声音一起输入,最高输出 15 秒 2K 音视频
真实创作一般需要融合不同模态的复杂信息,用户使用 MiniMax H3 创作时,可以同时输入参考视频、人物图片和声音,要求模型进行复杂创作。
MiniMax 给出的案例中,要求模型 " 参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3"。
参考视频:
参考图片:

在输出侧,H3 最高支持 15 秒、2K 分辨率,并能联合生成人声、音效和音乐,音频默认为原生双声道。除上述案例外,MiniMax 还展示了 H3 生成电影片头、游戏 UI、动态海报以及广告电商内容的效果。
游戏 UI:
视频中,角色打开装备,进入零部件选择、配置确认和加载界面,最终切换到霓虹灯街道中的游戏画面。整个交互过程衔接流畅,界面反馈自然,营造出色彩丰富的赛博朋克游戏氛围。
动态海报:

广告电商:

二、统一生成、参考和编辑任务,用自然语言连接不同模态
在 H3 之前,MiniMax 先后研发了 Hailuo 01 和 Hailuo 02 两代视频模型。其中,Hailuo 01 主要完成视频生成系统的从 0 到 1 搭建,Hailuo 02 则重点提升架构效率、数据质量和模型规模。
研发 H3 时,MiniMax 将重点从单项能力提升转向任务统一和泛化。
过往生成模型通常在任务上具有局限性:图片生成通常被拆分为文生图、图片编辑、主体参考、动作参考和风格参考等任务;声音生成又被分为人声、音效和音乐;视频生成则进一步细分为文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考和视频编辑。
MiniMax 认为,这些边界虽然方便产品定义,却限制了用户自由组合素材的能力,也会让模型在训练阶段过早适应有限的任务形式。H3 因此在预训练阶段就混合图像、视频、音频以及多种参考和编辑数据。
H3 的预训练任务包括文生图、文生视频和文生音频。其中,视频训练同时覆盖音频联合生成和多镜头建模;音频训练不再区分人声、音效和音乐,而是进行统一建模。
参考和编辑任务则覆盖图片到图片、图片到视频、音频到音频以及音视频到音视频等组合。不同素材之间的参考、保留和修改关系,均通过自然语言描述,不被限制在少数预定义任务中。
在数据选择上,H3 的广义参考和编辑训练主要采用真实自然数据,以提高数据扩展能力。MiniMax 将语言视为连接不同模态和任务的桥梁,希望模型借助语言理解开放式创作意图,而不是只识别固定功能标签。
训练策略上,MiniMax 选择尽早融合不同类型的数据和任务,并通过调整数据配比,让模型在预训练阶段就形成多模态上下文理解与生成能力。
三、四项技术降低训练和 2K 生成成本,后续将融合 M 系列能力
为实现多模态上下文理解,MiniMax 首先构建了Contextual Omni Representation(上下文全模态表示),用语言同时描述目标视频、参考素材以及不同素材之间的关系。MiniMax 通过定制模型和全模态理解管线,大部分素材需要消耗约 10 万 Token 的推理,最终压缩为平均约 4K 的 Token。
H3-VAE则通过提高视觉信息压缩率,带来 4 倍的序列长度收益,大幅降低训练和推理成本,并为 2K 分辨率输出提供技术支持。
架构方面,MiniMax 没有沿用 Hailuo-02 架构,而是采用更通用的H3-Omni Transformer。面对扩大 3 倍的序列长度方差,以及理解和生成任务之间不同的计算负载,H3 采用异构训练架构并优化样本间负载均衡,MiniMax 称其端到端训练吞吐提升近 30%。
生成 2K 视频时,H3 也没有使用独立超分辨率模块,而是通过In-context Regeneration(上下文再生),让基模结合原始多模态上下文重新生成高分辨率画面。MiniMax 称,这种方式能够复用基模已有能力,并更好地还原小文字和局部细节。
MiniMax 也提到,H3 在复杂多模态理解、模型规模和部分场景的画面精细度上仍有提升空间。后续 H 系列将进一步融合 M 系列模型能力,并继续扩大模型规模、提高画面分辨率和细节表现。
结语:全模态视频生成走向统一模型
MiniMax H3 试图用统一的全模态生成架构,取代过去被拆分为文生图、图生视频、音色参考、动作迁移等彼此隔离的任务管线。
随着模型开始同时接收语言、图片、视频和声音,视频生成工具的产品形态也可能从 " 输入提示词、生成一段视频 ",逐步转向理解完整创作意图,并参与内容生产全过程。
H3 能否兑现这一方向,仍要看其在复杂多模态指令稳定性、2K 分辨率画面精细度、音画同步质量、真实生成成本等方面的实测表现。
来源:MiniMax


登录后才可以发布评论哦
打开小程序可以发布评论哦