三易生活 18小时前
MiniMax H3发布,支持15秒2K分辨率视频输出
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

近日,MiniMax(稀宇科技)正式发布全模态生成模型 MiniMax H3,支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,并可生成具备原生双声道的音视频内容,最高支持 15 秒、2K 分辨率的视频输出。据官方透露,MiniMax H3 将在未来几天开放模型权重。

据了解,MiniMax H3 面向广告、电商、品牌、产品设计、UI/UX、游戏等内容创作场景,可实现多模态内容的编辑与生成。官方公布的信息显示,该模型在指令遵循、文字及品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面进行了优化。

技术层面,MiniMax H3 此次新增 Caption 能力,并配备专属模型和全模态理解管线,大部分素材需要约 100K Token 进行推理,并最终压缩至约 4K Token。此外,其 2K 视频输出并未采用传统超分模块,而是借助 H3 基础模型对低分辨率结果进行重新生成,以完成高分辨率视频输出。

近年来,MiniMax 持续推进大模型能力的建设。此前在 2025 年,其发布并开源 MiniMax-01 系列模型,覆盖基础语言模型和视觉多模态模型,参数量高达 4560 亿,其中单次激活 459 亿。该模型的综合性能比肩海外顶尖模型,同时能够高效处理全球最长 400 万 token 的上下文,是 GPT-4o 的 32 倍,Claude-3.5-Sonnet 的 20 倍。

随后 MiniMax 相继推出 image-01 图像生成模型、Hailuo 02 视频生成模型、speech-02 语音模型以及推理模型 MiniMax-M1,进一步完善文本、图像、视频、语音等多模态产品的布局。

今年 6 月,MiniMax 发布并开源推理模型 MiniMax-M3,其基于自研 MSA(MiniMax Sparse Attention)架构,可将上下文窗口扩展至 1M 级别,并在 BrowseComp、SWE-Bench Pro 等国际权威评测中达到前沿水平。作为原生多模态模型,M3 重构了整个数据管线,从第零步开始多模态训练,使文本和视觉语义空间高度对齐。

【本文图片来自网络】

加入收藏 点赞 ( 0 ) 踩 ( 0 )

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

分辨率 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论