智东西 08-03
又一国产模型重磅开源!有声视频编辑全球第一,16家芯片及平台首日适配
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 杨京丽

编辑 | 李水青

智东西 8 月 3 日报道,今日,MiniMax 正式开源新一代通用视频模型MiniMax H3

MiniMax H3 是一个通用型全模态生成系统,可统一理解文本、图像、视频和音频组成的多模态上下文,生成最长 15 秒、最高 2K 分辨率并带有原生立体声音频的视频。

此前 7 月 31 日,MiniMax H3 发布目前,在 Artificial Analysis 有声视频编辑榜单中,MiniMax H3 以 1130 分的 Elo 成绩位列第一,领先 Gemini Omni Flash、HappyHorse-1.0、Wan 2.7 等国内外视频模型。

MiniMax H3 位列有声视频编辑榜单榜首

H3 系统由H3-Context-IR、H3-Base、H3-Regenerate-2K三个模块组成。开发者可以直接从 Hugging Face 下载 MiniMax H3 模型,H3-Base 目前支持通过 SGLang、vLLM、diffusers 和 ComfyUI 等推理框架和工作流进行部署。

与模型开源同步,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 等国内外芯片厂商,以及 Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub、fal 等开发社区和云推理平台,另有 vLLM-Omni、SGLang 等推理框架,共 16 家生态伙伴均完成了相关适配支持。

开源地址:

huggingface.co/MiniMaxAI/MiniMax-H3

模型体验地址:

H3-2K 直出:

platform.minimaxi.com/docs/api-reference/video-generation-v2-create

H3-Context-IR: platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-ir

H3-Regenerate-2K: platform.minimaxi.com/docs/api-reference/video-generation-v2-regeneration

MiniMax Hub: hub.minimaxi.com

海螺 AI:hailuoai.com

今天,智东西对 MiniMax H3 进行了实测。MiniMax H3 已经能够完成不同类型的视频生成任务,在画面自然度、镜头组织和整体风格一致性方面表现较好。模型在画面真实感、镜头编排等方面有一定的提升空间。

比如,我们让模型生成了一段 15 秒的风光摄影航拍视频,成片中的雪山、草地等自然景观较为真实,色彩、光影和航拍镜头运动也比较自然,长镜头整体保持了较好的视觉连贯性。不过,画面中的寺庙建筑仍有较明显的 AI 生成感。

随后,我们又让 MiniMax H3 生成了一段奶茶和游戏 IP 联动的广告宣传视频。MiniMax 生成的视频包含 6 个分镜头,整体叙事顺序较为清楚,画面风格和广告氛围也基本统一。不过,在多镜头编排方面,模型出现了一处较明显的重复:店员向顾客递出奶茶的动作被连续呈现了两次。

一、最长生成 15 秒 2K 视频,画面与立体声同步输出

MiniMax H3 是一个通用型全模态生成系统。在输出规格方面,H3 可生成 4 秒至 15 秒的视频,支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种画面比例,输出帧率为 24FPS,并可同步生成 32kHz 立体声音频。

模型默认生成短边为 768 像素的视频,通过 H3-Regenerate-2K 可进一步生成 2K 版本。H3 稳定支持中文、英语、日语、韩语、法语、德语等 11 种语言,对其他语言也提供不同程度的支持。

H3 包含 FL2VA 和 Ref2VA 两个版本,分别面向首尾帧生成与全模态参考生成。

H3-Base-FL2VA 为首尾帧模式,最多可输入两张图像。不输入图像时,模型执行文生视频任务;输入一张首帧或尾帧图像时,可生成对应的首帧生视频或尾帧生视频;同时输入两张图像时,则可根据指定的首尾画面生成中间的视频内容。

H3-Base-Ref2VA 支持全模态参考模式,最多可输入 9 张图像;视频最多可输入 3 段,每段时长为 2 秒至 15 秒,总时长不超过 15 秒;音频最多可输入 3 段,每段时长为 2 秒至 15 秒,总时长不超过 15 秒,且必须与图像或视频一同输入,不能作为唯一输入。图像、视频和音频文件合计最多可输入 12 个。

二、三大模块协同生成音视频,2K 画面采用上下文再生成

H3 系统由负责理解和整理多模态指令的 H3-Context-IR、负责生成音视频的 H3-Base,以及负责生成 2K 画面的 H3-Regenerate-2K 三个模块组成。

MiniMax H3 系统概览(图源:MiniMax)

H3-Context-IR 是一套托管式预处理与编排系统,能够理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成结果之间的关系。其内部工作流包括指令解析、跨模态关联、时序理解和复杂逻辑推理。

H3-Context-IR 依赖多阶段工作流,以及多个托管模型与服务,该模块暂未开源。MiniMax 目前提供了相应 API 和提示词指南,开发者可以据此搭建自己的多模态预处理系统。

视频提示词写作指南:

huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md

全参考模式输出指南:

huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md

H3-Base 负责实际的音视频生成。文本由 H3-Encoder 编码,视觉素材同时经过 H3-Encoder 和 H3-VisualVAE 处理,音频则由 H3-AudioVAE 编码。不同模态的信息随后被组织成统一序列,输入 H3-Omni-Transformer。

MiniMax H3-Base 架构概览(图源:MiniMax)

对于 H3 的 2K 分辨率输出,H3 没有采用传统的专用超分辨率模块,而是通过 H3-Regenerate-2K,让基础模型结合原始文本及多模态参考素材,对已经生成的 768p 视频重新生成。这种方式可以再次利用原始上下文,有助于还原小文字和精细纹理等仅凭低分辨率画面难以补全的信息。该模块目前同样尚未开源,开发者可通过官方 API 复现完整的 2K 生成流程。

三、本地部署可生成 768p 音视频,完整 2K 工作流需调用 API

MiniMax 为开发者提供了 H3-Base 本地部署和完整 2K 工作流两种验证方式。H3-Base 以 FL2VA 和 Ref2VA 两个独立模型仓库发布,均包含处理器、分词器、文本编码器、Omni Transformer、Visual VAE 和 Audio VAE 等推理组件,可通过 SGLang、vLLM、diffusers 和 ComfyUI 等框架或工作流部署,并支持多 GPU 并行推理。

仅在本地部署 H3-Base 时,开发者可以生成短边为 768 像素的音视频。其中,FL2VA 版本支持文生音视频及首尾帧生成,Ref2VA 版本支持联合参考图像、视频和音频,完成角色与场景保留、动作和嘴型编辑、音色参考等任务。

完整 2K 工作流则需要结合本地模型与官方 API:首先由 H3-Context-IR 理解并扩展用户输入,随后由本地部署的 H3-Base 生成 768p 音视频,最后通过 H3-Regenerate-2K 结合原始上下文重新生成 2K 视频。MiniMax 还提供了文生音视频、首帧生音视频和全模态参考生成等可复现案例,相关请求参数、示例代码和参考结果均可在 Hugging Face 模型页面查看。

结语:全模态视频生成加速走向开放生态

从实际效果来看,MiniMax H3 已经能够处理自然风光、商业广告等不同类型的生成任务,在画面自然度、镜头组织和风格一致性方面展现出较高的完成度。

随着多家芯片厂商、开发社区、云推理平台和推理框架同步完成适配,MiniMax H3 此次开源不仅开放了模型能力,也初步打通了从模型下载、本地部署到应用开发的生态链路。全模态视频模型之间的竞争,正从单一画面效果进一步延伸至声音生成、复杂指令理解和产业生态建设。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

华为 开源 芯片 智东西 分辨率
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论