财经头条 14小时前
MiniMax H3发布,还要开源,AI视频终于有了自己的后期之王。
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

来源:数字生命卡兹克

今天,被 Seedance 2.0 压制了整整半年,沉寂了很久的 AI 视频模型行业,终于又有了点新的动向了。

MiniMax,终于掏出了他们的 H3 模型。

并且,要开源。

AI 视频,终于也开始向大模型领域看齐了。

过去这半年,AI 视频行业活得很奇怪。

视频 Agent 应用疯狂增长,但是模型却寥寥无几。

最后绕不开的那个名字,依然是 Seedance 2.0。

它就像那一堵最高的山。

以至于过去半年,AI 视频行业最大的悬念,逐渐变成了:

到底还有没有人,能给 Seedance 2.0 一点压力?

现在,MiniMax 终于带着他们的 AI 视频模型来了。

我在昨天其实就已经拿到了体验资格,在做了一些测试之后,我非常坦率的讲,在很多的环节上,它确实可以跟 Seedance 2.0 相媲美,但是还没有达到所谓的全面超越的地步。

但 H3 找到了一个非常独特、非常有意思、而且我觉得极其商业的切口,那就是:

视觉包装和后期特效。

这个点,MiniMax 实在是太强太强了,这块的长板强到比 Seedance 2.0 都要强很多。

我直接放几个 case 你就懂了。

H3 这个模型非常的独特。

独特到一时我不知道该用什么词去形容它。

你可以让它直接生成一段带歌词的动态 MV。

你也可以给它几张平面海报,它可以把排版、文字和视觉元素全部动起来,做成一支动态海报。

你也可以给它一堆照片,它能理解每张照片里的内容,自动做成有装饰、有节奏、有声音的 Vlog。

你甚至可以让它直接生成电影片头、歌词 VJ、时尚品牌 Campaign、游戏 UI、网页滚动动效和产品发布片。

只要涉及到一切跟视觉包装相关的工作,它干的都极佳。

如果说,Seedance 更偏向与前期,更重影视和特效,那 H3 我觉得,就更偏向后期,更重广告与动效。

两者相辅相成,终于补全了整个视频制作的全流程。

网址在此:https://hailuoai.com/

在首页上,你就能看到这次全新的 H3 了,也是一个原生多模态模型。

在纯粹的功能上,非常的全面,全能参考啥的也都有。

支持视频图片音频等等的各种参考,最多 12 个。

参数上,目前开放的直接是 2K,甚至 768P 的都暂时还没开放,最多 15s。

价格上 2K 的效果,1 秒是 12 贝壳,差不多就是 10 块钱一条 15 秒的 2K 视频。

动作参考、指定元素替换、换背景、改写视频、实拍视频加特效、绿幕换背景、白模视频上色、视频续写延长、视频整体参考等等这些常用的功能,也都没啥问题,而且效果不错。

这次的重点,我们自然还是要回到,视觉包装上。

其实我们会发现在过去半年里面,AI 视频加速的最多的是 AI 短剧赛道。

而传统的商业广告、宣传片、综艺等等,AI 介入的好像还没有那么多。

原因特别简单,过去我们一直在做的 AI 视频模型更像是一台很强的虚拟摄影机,它们能够凭空创造一个世界,然后把这个世界拍下来,记录下来。

但是,摄像机拍完以后,一条真正意义上的视频,其实才刚刚开始。

因为人类最终看到的绝大多数视频,都不是现实世界原封不动的切片。

我们会剪辑,会加字幕,会设计片头,会制造转场,会用图形、文字、UI 和特效重新组织信息。

这些东西,现实世界里原本都不存在。

它们全部是人类创造出来的视觉语言。

这些就是视觉包装。

最典型的就是综艺里面经常会加的花字。

这种以前 AI 视频几乎没有办法去处理,因为很难生成稳定加准确的文字,且很难理解文字与视频素材和视频内容之间的关系。

但是这一次,MiniMax H3 可以搞定这种了。

比如一个飞行嘉宾出场,以前我们可能得做很复杂的动画,然后 K 很多的帧,搞得还挺麻烦的,现在,一个 Prompt。

这个效果当然跟顶级综艺没有办法比,也会出现一些奇奇怪怪的数字。但是你可以看到关于人物的、氛围的、元素的设计,还有一些主体背景跟文字之间的互动,其实都已经做得很不错了。

在品牌语言上也是比较统一的。

除了综艺,还有很多很多需要做视觉包装的,比如说 MV。

Prompt:15 秒,16:9 横版,一镜到底。生成一支极具视觉炫技感的实验 MV。主角是一位银色寸头、穿纯黑长外套的中性歌手。摄影机始终围绕主角顺时针旋转,人物持续对镜头演唱,嘴型和身份稳定。   同一个废弃摄影棚随着摄影机旋转,依次转化为五种视觉世界:真实胶片、黑白报纸、彩色黏土、透明水下、像素游戏。每次变化都由主角动作和歌词触发,空间连续,不使用硬切。歌词与文字:   "CHANGE THE FRAME" "KEEP THE FACE" "EVERY   WORLD   IS   MINE"   0 至 3 秒:真实胶片摄影棚。主角抬手唱出 "CHANGE THE FRAME",手掌扫过的位置变成黑白报纸网点,文字像报纸标题一样从墙面展开。   3 至 6 秒:摄影机继续环绕,报纸世界被主角撕开,空间变成彩色黏土。人物仍保持真人皮肤和真实脸,周围道具与地面变成手工黏土。"KEEP THE FACE" 沿主角身后弯曲出现。  6 至 9 秒:主角跺脚,黏土地面化成透明水面。摄影机与人物同时进入水下,头发、衣服和气泡符合真实水体运动,歌声保持清晰。   9 至 12 秒:主角拍碎水面,所有水滴变成像素方块。摄影棚加载成复古三维游戏世界,人物仍为真人。"EVERY   WORLD   IS   MINE" 形成巨大的游戏关卡入口。   12 至 15 秒:摄影机完成一整圈环绕。所有视觉世界像多层皮肤一样从空间剥落,回到最初摄影棚。主角站在原位,伸手接住一枚同时包含五种材质的小方块。   声音:原创实验电子乐,五个世界分别拥有胶片、纸张、黏土、水下和像素音色,节奏连续。   禁止切镜头、人物换脸、服装变化、世界突然跳变、额外歌词、普通蒙版转场和水下嘴型失控。

可以看到生成出来的这个运镜效果其实非常的棒,而且文字极其准确,歌词全部都是对上的。

除了一些特别小的字,稍微大一点,几乎都没崩。

视觉包装做的非常的棒,在转场和过渡上也非常的和谐。

而且大家可以对比一下我的 Prompt,H3 有个非常强的特点,就是它的语义遵循能力极强,你真的就是说什么,它就能给你实现出什么,在做视觉包装的时候非常有用,因为做视觉包装很多时候就是极其精确的文字控制。

当然,这种语义遵循强的能力也带来了一些缺点,就是在某些影视级别的需要超强张力的镜头上,表现的没有 Seedance 效果好。

而这个 case 其实就能感觉到整个视觉包装的效果会更强一点,做了非常多的素材的包装和特效。

除了 MV,还有我们经常会做的 logo 演绎的视觉包装。

H3 做的也非常有意思。

比如,我就把我们公司的 logo,给扔了进去,让 H3 给我做一个 logo 演绎视频。

你别说,做的还是相当酷炫的。

当然,你还可以做电商产品的某一次全新的新品宣传片。

一个 AI 影视节目的片头。

一个设计大会的主舞台宣传片。

还有很多很多,电商、游戏、短视频,甚至还能给 Vlog 做好玩的动效等等。

你不需要再去做复杂的动效,不需要再去手 K 素材,甚至你都不需要打开剪辑软件,把你的素材扔到 H3 里,然后说出你的需求。

一条经过视觉包装的视频,就可能已经做好了。

AI 视频模型过去最喜欢展示的,往往是最极限的画面。

巨龙、战争、跑酷、追车、爆炸、复杂运镜。

这些东西很爽,也很适合证明模型的上限。

可真正数量巨大、每天都在被生产、每天都有人愿意付钱的视频,很多都没有这么宏大。

品牌广告、电商素材、产品介绍、App 功能演示、活动预告、社交媒体短片、游戏 PV、企业宣传片。

它们的生命周期很短,更新频率很高,经常还要针对不同人群、不同平台、不同尺寸,做出一大堆版本。

这种内容最需要的能力,恰好就是 H3 擅长的东西。

设计师和后期的价值,也会继续往上游移动。

手动拉关键帧、做素材、套转场这类执行工作的价值还会下降。

定义方向、建立审美、识别好坏、控制品牌一致性的价值,会越来越高。

生产能力越泛滥,判断力就越值钱。

而且大家不要忘了,MiniMax H3,是要开源的。

一个开源模型的生命力,往往是从发布那一天才刚刚开始。

后面一定会有人继续去给它做推理优化,给它去微调特定风格。未来我们可能会看到无数种特化的,在垂直领域继续发光发热的 H3 版本出来。

这个世界需要开源。

每一个愿意开源的,也都是英雄。

现在,MiniMax H3,来当那个英雄了。

我们也希望,能看到越来越多的 AI 视频领域的开源模型。

那才是真正的未来。

特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的 30 天内进行。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 开源 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论