手机中国 昨天
摩尔线程完成MiniMax H3模型适配 基于智算卡MTT S5000
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

【CNMO 科技消息】据 CNMO 科技了解,MiniMax 近日正式开源多模态生成模型 MiniMax H3。与此同时,摩尔线程宣布,已基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈,完成对 MiniMax H3 的适配与运行。

MiniMax

MiniMax H3 是一套通用型全模态生成系统,可统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。此次开源内容包括模型权重,同时提供本地部署和完整工作流验证方案。

MiniMax H3

从架构来看,H3 系统由三个核心模块组成。其中,H3-Context-IR 负责理解并提炼用户输入的多模态指令,将其转换为结构化的上下文中间表示,目前通过 API 提供;H3-Base 根据中间表示生成 768p 分辨率音视频内容,是此次开源主体;H3-Regenerate-2K 则将 768p 结果与原始上下文一同送回模型,以 2K 分辨率重新生成更高画质视频,该模块暂未开源,也通过 API 提供。

在模型设计上,H3-Base 采用 330 亿参数的 H3-Omni-Transformer 架构,通过不同模态编码器将文本、图像、视频和音频统一编码为多模态序列后进行联合预测。其下包含 H3-VisualVAE 和 H3-AudioVAE,分别用于视觉和音频信息压缩。官方同时提供两个主要版本,分别面向文生视频、首尾帧生视频,以及多图像、多视频、多音频混合输入等任务,适用于人物与场景保留、动作和嘴型编辑等场景,并支持包括中文、英语、日语、韩语在内的 11 种语言对话。

为方便开发者部署,官方给出 "H3-Base 本地部署 " 和 " 完整 2K 工作流 " 两条验证路径,支持通过 SGLang、vLLM、diffusers、ComfyUI 等框架进行推理。模型目前基于 MiniMax H3 Community License 发布,开发者可通过开源平台下载使用。

版权所有,未经许可不得转载

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

摩尔 ai 开源 分辨率 日语
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论