【CNMO 科技消息】7 月 31 日,MiniMax 发布新一代多模态生成模型 MiniMax H3,并宣布将在近期开放模型权重。与过去分别处理图片、视频和声音的专项模型不同,H3 更强调对多模态上下文的统一理解,试图从 " 完成单项生成任务 " 进一步转向通用多模态创作。

MiniMax
据 CNMO 科技了解,MiniMax H3 支持文本、图片、音频和视频等多种输入形式,可以直接输出 2K 分辨率内容,最长生成 15 秒的音画作品。用户可将不同类型的素材放在同一上下文中,由模型统一理解画面、声音、文字与创作要求,再完成连贯的内容生成或编辑。

MiniMax H3
视频编辑是 H3 此次展示的重点能力。该模型支持 V2V Motion Transfer,即将一段参考视频中的人物动作和运动轨迹迁移到另一段视频中,同时尽量保持主体形象与画面风格。对于广告、品牌和电商内容,H3 还强化了指令遵循、文字呈现以及品牌信息还原能力,减少生成内容中经常出现的文字错误和标识变形。

CNMO 科技了解到,MiniMax H3 在 Artificial Analysis 音频视频编辑榜单中位列全球第一。随着 H3 后续开源,高质量音画生成及视频编辑的使用门槛将进一步降低。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦