来源:数字生命卡兹克
今天,被 Seedance 2.0 压制了整整半年,沉寂了很久的 AI 视频模型行业,终于又有了点新的动向了。
MiniMax,终于掏出了他们的 H3 模型。
并且,要开源。

AI 视频,终于也开始向大模型领域看齐了。
过去这半年,AI 视频行业活得很奇怪。
视频 Agent 应用疯狂增长,但是模型却寥寥无几。
最后绕不开的那个名字,依然是 Seedance 2.0。
它就像那一堵最高的山。
以至于过去半年,AI 视频行业最大的悬念,逐渐变成了:
到底还有没有人,能给 Seedance 2.0 一点压力?
现在,MiniMax 终于带着他们的 AI 视频模型来了。
我在昨天其实就已经拿到了体验资格,在做了一些测试之后,我非常坦率的讲,在很多的环节上,它确实可以跟 Seedance 2.0 相媲美,但是还没有达到所谓的全面超越的地步。
但 H3 找到了一个非常独特、非常有意思、而且我觉得极其商业的切口,那就是:
视觉包装和后期特效。
这个点,MiniMax 实在是太强太强了,这块的长板强到比 Seedance 2.0 都要强很多。
我直接放几个 case 你就懂了。
H3 这个模型非常的独特。
独特到一时我不知道该用什么词去形容它。
你可以让它直接生成一段带歌词的动态 MV。
你也可以给它几张平面海报,它可以把排版、文字和视觉元素全部动起来,做成一支动态海报。
你也可以给它一堆照片,它能理解每张照片里的内容,自动做成有装饰、有节奏、有声音的 Vlog。
你甚至可以让它直接生成电影片头、歌词 VJ、时尚品牌 Campaign、游戏 UI、网页滚动动效和产品发布片。
只要涉及到一切跟视觉包装相关的工作,它干的都极佳。
如果说,Seedance 更偏向与前期,更重影视和特效,那 H3 我觉得,就更偏向后期,更重广告与动效。
两者相辅相成,终于补全了整个视频制作的全流程。
网址在此:https://hailuoai.com/

在首页上,你就能看到这次全新的 H3 了,也是一个原生多模态模型。
在纯粹的功能上,非常的全面,全能参考啥的也都有。

支持视频图片音频等等的各种参考,最多 12 个。
参数上,目前开放的直接是 2K,甚至 768P 的都暂时还没开放,最多 15s。

价格上 2K 的效果,1 秒是 12 贝壳,差不多就是 10 块钱一条 15 秒的 2K 视频。
动作参考、指定元素替换、换背景、改写视频、实拍视频加特效、绿幕换背景、白模视频上色、视频续写延长、视频整体参考等等这些常用的功能,也都没啥问题,而且效果不错。
这次的重点,我们自然还是要回到,视觉包装上。
其实我们会发现在过去半年里面,AI 视频加速的最多的是 AI 短剧赛道。
而传统的商业广告、宣传片、综艺等等,AI 介入的好像还没有那么多。
原因特别简单,过去我们一直在做的 AI 视频模型更像是一台很强的虚拟摄影机,它们能够凭空创造一个世界,然后把这个世界拍下来,记录下来。
但是,摄像机拍完以后,一条真正意义上的视频,其实才刚刚开始。
因为人类最终看到的绝大多数视频,都不是现实世界原封不动的切片。
我们会剪辑,会加字幕,会设计片头,会制造转场,会用图形、文字、UI 和特效重新组织信息。
这些东西,现实世界里原本都不存在。
它们全部是人类创造出来的视觉语言。
这些就是视觉包装。
最典型的就是综艺里面经常会加的花字。
这种以前 AI 视频几乎没有办法去处理,因为很难生成稳定加准确的文字,且很难理解文字与视频素材和视频内容之间的关系。
但是这一次,MiniMax H3 可以搞定这种了。
比如一个飞行嘉宾出场,以前我们可能得做很复杂的动画,然后 K 很多的帧,搞得还挺麻烦的,现在,一个 Prompt。
这个效果当然跟顶级综艺没有办法比,也会出现一些奇奇怪怪的数字。但是你可以看到关于人物的、氛围的、元素的设计,还有一些主体背景跟文字之间的互动,其实都已经做得很不错了。
在品牌语言上也是比较统一的。
除了综艺,还有很多很多需要做视觉包装的,比如说 MV。
Prompt:15 秒,16:9 横版,一镜到底。生成一支极具视觉炫技感的实验 MV。主角是一位银色寸头、穿纯黑长外套的中性歌手。摄影机始终围绕主角顺时针旋转,人物持续对镜头演唱,嘴型和身份稳定。 同一个废弃摄影棚随着摄影机旋转,依次转化为五种视觉世界:真实胶片、黑白报纸、彩色黏土、透明水下、像素游戏。每次变化都由主角动作和歌词触发,空间连续,不使用硬切。歌词与文字: "CHANGE THE FRAME" "KEEP THE FACE" "EVERY WORLD IS MINE" 0 至 3 秒:真实胶片摄影棚。主角抬手唱出 "CHANGE THE FRAME",手掌扫过的位置变成黑白报纸网点,文字像报纸标题一样从墙面展开。 3 至 6 秒:摄影机继续环绕,报纸世界被主角撕开,空间变成彩色黏土。人物仍保持真人皮肤和真实脸,周围道具与地面变成手工黏土。"KEEP THE FACE" 沿主角身后弯曲出现。 6 至 9 秒:主角跺脚,黏土地面化成透明水面。摄影机与人物同时进入水下,头发、衣服和气泡符合真实水体运动,歌声保持清晰。 9 至 12 秒:主角拍碎水面,所有水滴变成像素方块。摄影棚加载成复古三维游戏世界,人物仍为真人。"EVERY WORLD IS MINE" 形成巨大的游戏关卡入口。 12 至 15 秒:摄影机完成一整圈环绕。所有视觉世界像多层皮肤一样从空间剥落,回到最初摄影棚。主角站在原位,伸手接住一枚同时包含五种材质的小方块。 声音:原创实验电子乐,五个世界分别拥有胶片、纸张、黏土、水下和像素音色,节奏连续。 禁止切镜头、人物换脸、服装变化、世界突然跳变、额外歌词、普通蒙版转场和水下嘴型失控。
可以看到生成出来的这个运镜效果其实非常的棒,而且文字极其准确,歌词全部都是对上的。

除了一些特别小的字,稍微大一点,几乎都没崩。
视觉包装做的非常的棒,在转场和过渡上也非常的和谐。
而且大家可以对比一下我的 Prompt,H3 有个非常强的特点,就是它的语义遵循能力极强,你真的就是说什么,它就能给你实现出什么,在做视觉包装的时候非常有用,因为做视觉包装很多时候就是极其精确的文字控制。
当然,这种语义遵循强的能力也带来了一些缺点,就是在某些影视级别的需要超强张力的镜头上,表现的没有 Seedance 效果好。
而这个 case 其实就能感觉到整个视觉包装的效果会更强一点,做了非常多的素材的包装和特效。
除了 MV,还有我们经常会做的 logo 演绎的视觉包装。
H3 做的也非常有意思。
比如,我就把我们公司的 logo,给扔了进去,让 H3 给我做一个 logo 演绎视频。
你别说,做的还是相当酷炫的。
当然,你还可以做电商产品的某一次全新的新品宣传片。
一个 AI 影视节目的片头。
一个设计大会的主舞台宣传片。
还有很多很多,电商、游戏、短视频,甚至还能给 Vlog 做好玩的动效等等。
你不需要再去做复杂的动效,不需要再去手 K 素材,甚至你都不需要打开剪辑软件,把你的素材扔到 H3 里,然后说出你的需求。
一条经过视觉包装的视频,就可能已经做好了。
AI 视频模型过去最喜欢展示的,往往是最极限的画面。
巨龙、战争、跑酷、追车、爆炸、复杂运镜。
这些东西很爽,也很适合证明模型的上限。
可真正数量巨大、每天都在被生产、每天都有人愿意付钱的视频,很多都没有这么宏大。
品牌广告、电商素材、产品介绍、App 功能演示、活动预告、社交媒体短片、游戏 PV、企业宣传片。
它们的生命周期很短,更新频率很高,经常还要针对不同人群、不同平台、不同尺寸,做出一大堆版本。
这种内容最需要的能力,恰好就是 H3 擅长的东西。
设计师和后期的价值,也会继续往上游移动。
手动拉关键帧、做素材、套转场这类执行工作的价值还会下降。
定义方向、建立审美、识别好坏、控制品牌一致性的价值,会越来越高。
生产能力越泛滥,判断力就越值钱。
而且大家不要忘了,MiniMax H3,是要开源的。
一个开源模型的生命力,往往是从发布那一天才刚刚开始。
后面一定会有人继续去给它做推理优化,给它去微调特定风格。未来我们可能会看到无数种特化的,在垂直领域继续发光发热的 H3 版本出来。
这个世界需要开源。
每一个愿意开源的,也都是英雄。
现在,MiniMax H3,来当那个英雄了。
我们也希望,能看到越来越多的 AI 视频领域的开源模型。
那才是真正的未来。
特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的 30 天内进行。


登录后才可以发布评论哦
打开小程序可以发布评论哦