智东西 昨天
2K画质,三成价格!钱包友好型国产视频模型来了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

智东西

作者 | 杨京丽

编辑 | 李水青

智东西 7 月 31 日报道,今日,MiniMax 发布通用全模态生成模型MiniMax H3。该模型能够统一理解文本、图像、视频和声音,并生成带原生双声道的音视频,最高支持15 秒、2K 分辨率输出。

MiniMax 称,该模型在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面表现出色,可用于广告、品牌、电商、产品设计、UI/UX 和游戏等场景。

价格方面,MiniMax 称其有能力提供行业内最优的性价比,模型在 2K 分辨率下每秒价格不到主流模型的1/3,768P 分辨率下不到1/2,具体价格暂未公布。

目前,MiniMax H3 在第三方评测机构 Artificial Analysis 的文生视频有声榜单中排名第二,Elo 得分为 1242 分,略低于谷歌 Gemini Omni Flash 的 1245 分。

MiniMax 计划在未来几天内,在符合相关法律法规的前提下,开放模型权重,推动开源生态和国产芯片适配。

一、文本、图片、视频、声音一起输入,最高输出 15 秒 2K 音视频

真实创作一般需要融合不同模态的复杂信息,用户使用 MiniMax H3 创作时,可以同时输入参考视频、人物图片和声音,要求模型进行复杂创作。

MiniMax 给出的案例中,要求模型 " 参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3"。

参考视频:

参考图片:

H3 会分别提取视频中的镜头运动、图片中的人物身份和音频中的声音特征,再根据自然语言描述组合成新视频。

在输出侧,H3 最高支持 15 秒、2K 分辨率,并能联合生成人声、音效和音乐,音频默认为原生双声道。除上述案例外,MiniMax 还展示了 H3 生成电影片头、游戏 UI、动态海报以及广告电商内容的效果。

游戏 UI:

视频中,角色打开装备,进入零部件选择、配置确认和加载界面,最终切换到霓虹灯街道中的游戏画面。整个交互过程衔接流畅,界面反馈自然,营造出色彩丰富的赛博朋克游戏氛围。

动态海报:

画面开始时,人物以较小比例出现在粉色矩形底部,随后绿色标题文字从背景中显现,人物快速放大并向镜头伸手,形成冲出海报的立体效果,整体色彩和视觉风格较为统一

广告电商:

电商广告视频先后展示模特佩戴银色护目镜的面部特写和侧脸,随后切换至黑白服装模特的全身镜头、眼镜产品特写及双人定妆画面。不同镜头之间的光影、服装和银黑配色保持一致,镜片反光和金属材质较为突出,已经具备商业广告的基本质感

二、统一生成、参考和编辑任务,用自然语言连接不同模态

在 H3 之前,MiniMax 先后研发了 Hailuo 01 和 Hailuo 02 两代视频模型。其中,Hailuo 01 主要完成视频生成系统的从 0 到 1 搭建,Hailuo 02 则重点提升架构效率、数据质量和模型规模。

研发 H3 时,MiniMax 将重点从单项能力提升转向任务统一和泛化

过往生成模型通常在任务上具有局限性:图片生成通常被拆分为文生图、图片编辑、主体参考、动作参考和风格参考等任务;声音生成又被分为人声、音效和音乐;视频生成则进一步细分为文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考和视频编辑。

MiniMax 认为,这些边界虽然方便产品定义,却限制了用户自由组合素材的能力,也会让模型在训练阶段过早适应有限的任务形式。H3 因此在预训练阶段就混合图像、视频、音频以及多种参考和编辑数据

H3 的预训练任务包括文生图、文生视频和文生音频。其中,视频训练同时覆盖音频联合生成和多镜头建模;音频训练不再区分人声、音效和音乐,而是进行统一建模。

参考和编辑任务则覆盖图片到图片、图片到视频、音频到音频以及音视频到音视频等组合。不同素材之间的参考、保留和修改关系,均通过自然语言描述,不被限制在少数预定义任务中。

数据选择上,H3 的广义参考和编辑训练主要采用真实自然数据,以提高数据扩展能力。MiniMax 将语言视为连接不同模态和任务的桥梁,希望模型借助语言理解开放式创作意图,而不是只识别固定功能标签。

训练策略上,MiniMax 选择尽早融合不同类型的数据和任务,并通过调整数据配比,让模型在预训练阶段就形成多模态上下文理解与生成能力。

三、四项技术降低训练和 2K 生成成本,后续将融合 M 系列能力

为实现多模态上下文理解,MiniMax 首先构建了Contextual Omni Representation(上下文全模态表示),用语言同时描述目标视频、参考素材以及不同素材之间的关系。MiniMax 通过定制模型和全模态理解管线,大部分素材需要消耗约 10 万 Token 的推理,最终压缩为平均约 4K 的 Token。

H3-VAE则通过提高视觉信息压缩率,带来 4 倍的序列长度收益,大幅降低训练和推理成本,并为 2K 分辨率输出提供技术支持。

架构方面,MiniMax 没有沿用 Hailuo-02 架构,而是采用更通用的H3-Omni Transformer。面对扩大 3 倍的序列长度方差,以及理解和生成任务之间不同的计算负载,H3 采用异构训练架构并优化样本间负载均衡,MiniMax 称其端到端训练吞吐提升近 30%。

生成 2K 视频时,H3 也没有使用独立超分辨率模块,而是通过In-context Regeneration(上下文再生),让基模结合原始多模态上下文重新生成高分辨率画面。MiniMax 称,这种方式能够复用基模已有能力,并更好地还原小文字和局部细节。

MiniMax 也提到,H3 在复杂多模态理解、模型规模和部分场景的画面精细度上仍有提升空间。后续 H 系列将进一步融合 M 系列模型能力,并继续扩大模型规模、提高画面分辨率和细节表现。

结语:全模态视频生成走向统一模型

MiniMax H3 试图用统一的全模态生成架构,取代过去被拆分为文生图、图生视频、音色参考、动作迁移等彼此隔离的任务管线。

随着模型开始同时接收语言、图片、视频和声音,视频生成工具的产品形态也可能从 " 输入提示词、生成一段视频 ",逐步转向理解完整创作意图,并参与内容生产全过程。

H3 能否兑现这一方向,仍要看其在复杂多模态指令稳定性、2K 分辨率画面精细度、音画同步质量、真实生成成本等方面的实测表现。

来源:MiniMax

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

谷歌 分辨率 智东西 效果 界面
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论