最近的 AI 圈真是热闹,字节跳动和 MiniMax 同天发布重磅新品:Seedance 2.5 和 MiniMax H3。
多少有点像国产 AI 厂商约好了:"7 月最后一天,大家一起交作业了。"
但这作业真不是随便糊弄的。视频生成和多模态这条赛道,直接被拉进了 Next Level。
先来扒字节这头的 Seedance 2.5。
官方给的 title 是 " 新一代视频创作模型 ",但字节这次的野心,明显不是只想让你拿它做几个发朋友圈的炫技小视频。
从放出来的东西看,Seedance 2.5 已经开始朝专业战场摸过去了:宣传片、影视级镜头、教育科普,甚至那种正经企业级的视频工作流,它都想掺一脚。
最直观的升级,单次生成从 15 秒翻倍到了 30 秒。
别觉得 30 秒很短,在 AI 视频的世界里,多一秒都是另一个维度的事。15 秒你只能展示一个动作、一个场景,说白了就是个动图 Plus。
但 30 秒,足够模型去组织一个有头有尾的小故事了:铺垫、推进、变化、收尾,麻雀虽小五脏俱全。
官方展示的那个案例你们感受一下:歌手坐在化妆间里化妆、起身穿过灯光昏黄的后台通道、跟侧幕的舞伴们用眼神对了个节奏互相拍了拍肩膀,然后聚光灯打下来,她大步迈上舞台,舞伴从两侧汇入,走位、转身、对视,一气呵成。
完整 30 秒一镜到底,不带断的。这哪是生成视频啊,这分明是让 AI 拍了个 MV。
而且如果 30 秒还不够你发挥,Seedance 2.5 支持多轮延长。你可以基于已经生成的视频往后继续长,模型会尽量咬着人物、场景和整体风格不放。这对长剧情、广告片、影视预告这种场景,简直救命。
说到这里,必须聊聊 AI 视频圈那个老生常谈的痛:" 抽卡 "。
用过 AI 视频的狐友们应该都懂那种想砸电脑的感觉:单看每一个镜头都惊为天人,一剪辑到一起立马现原形。
人物发型、衣服颜色、五官细节,跟你玩变脸似的,随机切换。
为啥会这样?因为过去的 AI 视频模型本质上是把每个镜头当独立任务处理的。它脑子里没有 " 上一个镜头长啥样 " 这个存档,每次生成都是闭眼重新抽卡,概率采样。
别看那些 AI 大神做的短片好震撼,其实背后全是血泪史:一个镜头生成几十次甚至上百次,跟淘金似的,只为了从一堆废料里扒拉出一个能用的。
B 站那部封神的 AI 短片《牌子》应该有人看过吧?7 分钟的片子,据创作者透露,单个镜头最高生成了 3000 次,纯纯大力出奇迹。
也正因如此,Seedance 2.5 这次死磕的方向正是" 时序一致性 "。让同一个角色在 30 秒内,跨多个镜头,穿同一件衣服,长同一张脸。
另外官方还提了个特别有共鸣的词:" 油腻感 "。
懂的都懂,AI 视频那种通用毛病:人物皮肤跟统一批发了三斤高光似的,滤镜拉到失真,整个画面透着一股 " AI 网剧 " 的廉价味儿。
Seedance 2.5 这次在画质、音质、运动自然度上都做了优化,同时把多模态参考能力拉满了。单次输入最多能塞 30 张图片、10 段视频和 10 段音频进去当参考素材。
模型不光能认出素材里是谁,还能理解构图、场景风格、人物关系和声音特征,然后按你的要求重新组合。
特别是在多人场景里,它能死死按住不同人物的外貌、动作和声音,不让它们瞎跑偏。
但 Seedance 2.5 真正让影视民工两眼放光的,是那套编辑与时间戳能力。
你可以像写分镜脚本一样用时间戳调教视频:规定 " 0-5 秒推镜头,5-10 秒人物回头,10-15 秒爆炸 ",模型就老老实实按时间线执行。
还可以看哪段不顺眼,直接选中 " 片段重拍 ",像用 Photoshop 框选局部一样原地替换,其他地方原封不动。
更离谱的是绿幕编辑能力,你拍了一段人物在绿幕前的素材,想让背景换成火山喷发还是赛博都市,Seedance 2.5 直接抠掉绿幕把新场景塞进去。
关键是人物身上的飘带、衣褶的光影反射,会自动根据新场景的物理光照重新计算变动!
能力堆到这份上,字节当天甩出的合作名单也值得细品。
徐工、小鹏、智元、灵初、微分智飞、穹彻智能、Xspark AI...... 全是工业制造、汽车、机器人、智能驾驶的硬核玩家。
视频生成模型,正在跳出内容行业,一头扎进实体产业, 这信号太明显了。
以前企业要做个培训视频,要么搭景实拍,要么砸钱做 3D 动画,周期长、成本高,折腾半天还不一定能用。
现在呢?工业流程、设备操作、维修指导,AI 直接给你生成,效率完全不在一个维度上。比如,徐工集团就已经在用 Seedance 生成工业操作培训和工序 SOP 视频了。
最绝的是自动驾驶,以前要采集暴雨、大雾、碰撞风险这些极限数据,测试车得在路上跑几个月。现在 AI 直接造个虚拟世界,要多少有多少。
聊完字节,再转头看 MiniMax 这边,完全是另一条路数。
如果说 Seedance 2.5 是在帮 AI 提升当导演的能力,那 MiniMax H3 的脑回路就是:别管什么导演不导演了,我直接给你搭一个全能制作系统。
官方给 H3 的定位是一款通用的全模态生成模型,支持对文本、图像、视频、声音的统一理解和生成,能直接输出带原生双声道的音视频,最高 15 秒、2K 分辨率。
但 H3 真正狠的地方不在于 " 能生成 ",而在于它把一堆原本分散的活全捏在了一起。
过去的视频模型通常各司其职:文生视频、图生视频、视频编辑、动作迁移……想做一个完整作品,经常需要多个模型接力。
H3 的想法很粗暴:别拆了,全给我塞进一个模型里。
所以 H3 从一开始就把 " 任务的统一和泛化 " 当成第一纲领:人声、音效、音乐不分开建模,统一联合训练。
参考和编辑也不搞一堆专用接口,直接用自然语言描述你要啥,模型自己理解自己干。
举个官方给的例子你就明白了:你可以上传一段有特殊运镜的参考视频、一张人物图片、一段歌声,然后告诉它 " 参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3"。
H3 会自动拆解你的指令,把镜头运动、人物形象、歌声特征全部提取出来,融合成一个全新的视频。你不需要知道它是怎么做到的,说人话就行了。
根据前期的邀测反馈,H3 在指令遵循、文字与品牌信息呈现、视频到视频动作迁移这些方面表现都很能打。
官方把它定位在广告、品牌、电商、产品设计、UI/UX、游戏这些商业场景,说白了就是给那些需要快速出片、反复改稿的打工人准备的。
在 Artificial Analysis 的全球视频编辑榜上,H3 一发布直接登顶第一,把 Gemini Omni 都甩后面了。
价格也拉得挺低,2K 分辨率下每秒不到主流模型的三分之一,768P 下不到一半。这价不是靠补贴硬撑的,是架构优化硬抠出来的成本空间。
最狠的是,MiniMax 宣布 H3 开源,模型权重在魔搭社区正式发布。企业可以本地部署,拿自己的业务数据往上怼,随便优化。
两款模型,同一天发布,走的却是两条不同的路。
Seedance 2.5 一头扎进实体产业,给工厂、车企、机器人公司当生产力工具;MiniMax H3 直接开源,拉上所有开发者一起玩。一个往深了做,一个往宽了铺。
有网友锐评:旗鼓相当,但性格迥异。Seedance 2.5 更懂导演想拍什么,H3 更懂商业视频需要什么。一个像导演,一个像全能制作组。
赛道不同,终点一样:视频生成不能只停在 " 漂亮的片段 ",必须走向 " 可用的结果 "。
信息来源:火山引擎、MiniMax 官网等等
编辑:不吃麦芽糖


