定焦One 6小时前
MiniMax、字节同日出手,视频模型进入新赛段
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

越过生产门槛,开源才不是空谈。

定焦 One(dingjiaoone)原创

作者 | 苏友宁

编辑 | 阮梅

视频模型又卷起来了。

7 月 31 日,MiniMax 和字节跳动先后发布了各自的视频模型。

Seedance 2.5 将单次生成时长延长至 30 秒,增加了参考素材数量和局部编辑功能,提供 480P 和 720P 两档输出。H3 最长仍为 15 秒,但可以同时接收文字、图片、视频和音频,输出带双声道声音的 2K 视频。MiniMax 还承诺在数日内开放模型权重。

字节继续拉长镜头,MiniMax 准备放开模型。后者给这轮竞争增加了一个变量。

过去这个行业的规则是,谁手里的模型最强,谁就掌握价格、入口和分发。即便有视频模型开源,但能真正能嵌入真实制作流程的少之又少,要么画质不够稳,要么复杂指令易失真,或是改一处就牵动整段。这次,H3 把旗舰模型开源,动的正是这条规则。

它试图成为行业首个达到商用级水平、同时开放权重的多模态视频基座模型,在发布时交出了画质、精准编辑和音画协同能力。如果第三方能够复现这些能力,H3 的开源就不只是一场社区事件,还可能成为一次产业事件。

视频模型的下一程,也因此不只比谁的镜头更长、画面更好,还要比谁能进入更多工具和工作流,并最终把技术优势转化为换成实打实的调用量和收入。

01. 越过生产门槛,H3 凭什么谈开源?

一位独立电影创作者的吐槽,或许比跑分更能解释 H3 想解决什么。

创作者 chukwuDEJI 在 X 上说,他曾将同一条提示词反复提交给 Seedance,十多次被拒后只能放弃。换用刚刚发布的 H3 后,这个镜头很快生成,价格也更低。他感叹,如果 H3 早些发布,自己的电影或许已经能用上。

另一位创作者 padphone 只上传了一张产品图和一句提示词,H3 便生成了一段 2K 广告。真正打动他的除了清晰度本身,还有模型自行把光线、镜头和品牌调性都处理好了。

个案不能代替系统评测,但它们代表的方向一致,视频模型的竞争,正在从能不能生成转向能不能交付。

当分辨率、时长等指标被迅速追平,创作者在意模型能否理解真实任务、稳定执行指令,并让结果顺利进入后期。这也正好是理解 H3 的三个入口。

先看它如何理解素材。

过去,创作者得把人物、动作、运镜和声音全部翻译成提示词。需求越复杂,转述中的信息损耗越大。H3 允许素材本身成为指令:一次最多接收 9 张图片、3 段视频和 3 段音频,但混合素材总数不超过 12 份。广告导演可以直接提交产品图、品牌视觉、参考片和配乐;动画团队也可以把角色设定、动作样片和分镜一并交给模型。

在测试中,一些创作者只提供少量人物图片和一段音乐,模型便能自行组织画面。甚至有用户发现,参考图给得过多,反而会限制 H3 的发挥。这说明模型不只是在复刻素材,也在尝试理解素材之间的关系。

输出端同样在提升。H3 覆盖文生视频、图生视频和参考素材生成,最长可以输出 15 秒、带原生双声道音频的 2K 视频。它仍主要服务于单个镜头,不是一次生成完整影片,但能力范围已经进入头部视频模型的竞争区间。

其次是精准执行。

多位 AIGC 导演曾向「定焦 One」表示,实际生产中最头疼的往往不是生成,而是修改。只想替换桌上的商品,模型却可能连人物姿态、镜头节奏和画面色调一起改掉;一处局部调整,甚至会污染整段视频,团队只能重新 " 抽卡 "。

注:原视频背景是绿幕,童话感背景由 H3 替换

H3 将人物替换、背景更换和动作迁移等能力整合进同一模型,核心是识别哪些内容需要改变、哪些内容必须保留。它可以沿用参考动作只替换人物,保留主体关系只更换背景,也可以局部调整服装、声音或镜头节奏。多位测试者因此将 " 指令遵循 " 视为 H3 最突出的能力之一。

这项能力直接关系到成本。一段 AI 视频的真实价格,并不是模型标出的单次生成费用,得用 " 生成价格 × 抽卡次数 ",再加上人工返工成本。编辑越稳定,可用镜头的综合成本就越低。

第三,是能否进入后期。

过去,视频模型更擅长制造原料。团队拿到生成片段后,仍要分别处理字幕、动效、声音、转场和包装。每增加一个工具,都会多一次格式转换,也多一次素材错位的风险。

H3 开始把部分后期能力收进生成过程。它能基于已有视频补镜头、换元素、调风格,完成转场、卡点和视觉增强;也可以保持标题、品牌名和游戏 UI 的可读性,让文字服从画面的透视和运动;还能接收参考音频,完成音色克隆和音画协同,直接输出双声道声音。

H3 还不能取代完整后期,调色、混音、版权审核和精细剪辑,仍然需要专业人员。变化在于,它交付的是一份更接近制作要求、可以继续加工的镜头素材。

这也是讨论 H3 开源的前提。开源的分量,取决于被开放的能力站在什么位置。一款只能展示 Demo 的模型开放权重,无非是给市场添个备选;一款越过生产门槛的模型开源,才可能改变产业分工。

H3 试图做的正是后者,把画质、精准编辑和音画协同等核心能力带进开源体系,让开源视频模型有机会与闭源旗舰坐到同一张牌桌上。

当 " 开源 " 不再等于 " 次一级 ",视频生成的竞争规则也开始松动了。

02. 一款旗舰模型开源,会改变什么?

H3 开源的分量,可以先从一组差距看起。

在 Artificial Analysis 基于盲选投票的视频榜单中,H3 以 1242 分位列有声文生视频第二,仅比第一名 Gemini Omni Flash 低 4 分,高于 Seedance 2.0;在无声图生视频榜单中,它同样排名第二;在视频编辑榜单中,则以 1130 分位列第一。

图源 / Artificial Analysis

榜单会随投票变化,也替代不了真实生产中的长期检验。但它至少说明,开源与旗舰之间的差距在收窄。

过去使用视频模型,往往是一道取舍题:要最好的效果,就接受闭源厂商的产品、价格和规则;要部署自由,就接受相对落后的画质与能力。H3 想打破这种取舍。

最先改变的,是这项能力由谁提供。

闭源模型触达用户通常只有两条路:进入厂商自己的产品,或者通过官方接口对外收费。模型部署在哪里、运行在哪种芯片上、价格如何调整,主动权都掌握在模型公司手中。

开放权重相当于把一部分主动权交了出去。H3 发布当天,开发者平台 Vercel 将其接入自家服务,SeaArt 也宣布上线。这类接入依靠官方服务,可以迅速扩大模型触达范围;权重开放则更进一步,让第三方有机会改变模型的运行方式。

图源 / X

ComfyUI 核心开发者账号 comfyanonymous 在 Reddit 表示,团队已经提前拿到 H3 的权重和代码,将提供首日支持。经过优化,模型甚至可以在 RTX 3060 上运行,只是速度会慢一些。更关键的是,据其介绍,团队拿到的是与 API 一致的权重。

图源 / Reddit

这意味着,H3 交给社区的不是一个缩水版。MiniMax 还表示,H3 能够适配多款国产芯片,2K 视频的生成成本 0.8 元 / 秒,不到主流产品的三分之一。若这些条件能够被第三方稳定复现,视频模型的供应方就会从单一厂商扩展到云平台、推理服务商和本地部署团队。

第二层变化,是模型会从一款独立产品变成工具的底层。

大多数创作者不会下载权重,也不关心模型部署在哪块芯片上。他们接触 H3 的方式,更可能是剪辑软件里的一个按钮、设计工具里的一组功能,或电商后台里的一条自动化流程。所以模型能铺多广,不仅取决于海螺 AI 拥有多少用户,更要看多少产品愿意将 H3 做进自己的功能。

有些开源视频模型已经走过这条路。LTX-2 发布后很快获得 ComfyUI 支持;万相 Wan2.2 开放后,社区陆续补上各种适配,让它进入了更多工具、运行在更便宜的显卡,也能以较低成本训练出定制风格和角色。一款模型由此不再对应一个固定入口,它可以被拆进不同工具,与剪辑、配音、放大和角色控制自由组合。

H3 的不同在于,这回进入这套生态的,是一项已经接近闭源头部模型的能力。第三方产品不用先替基础画质 " 补课 ",可以直接围绕广告、电商、游戏和影视的工作流做产品。

更深一层的变化发生在企业内部:开源让模型有机会成为企业可控制的生产基础设施。

广告公司需要商品、Logo 和品牌色在每条视频中保持稳定;游戏公司需要角色与画风长期一致;影视团队还要考虑未公开素材和版权资产能否上传公有云。对这些客户而言,画质只是准入门槛,数据能否留在本地、模型能否围绕自有资产调整、成本能否被长期控制,才是真正的采购理由。

在许可允许、工具链成熟的前提下,企业可以私有部署 H3,并围绕品牌素材和业务流程继续训练。模型就不再是一个按次付费的外部服务,更像是企业自己掌握的一段生产链。第三方服务商也可以据此搭建工作流,将同一套能力带入广告、游戏、影视和电商等不同场景。

如果说闭源模型主要争夺用户,开源旗舰争夺的就是参与者。当更多公司能够部署、改造和分发同一项前沿能力,这场竞争就从几家厂商拼模型,扩展为不同生态之间的比拼。

不过,截至发布时,H3 的权重仍处于 " 即将开放 " 状态。ComfyUI 等合作方的提前适配,并不等于普通开发者已经可以自由部署。许可协议、完整配套代码和实际部署所需的算力成本,也尚未完全公布。

H3 能否真正成为产业底座,最终要看这些条件是否足够友好,以及第三方能否在官方产品之外,复现它所展示的画质、编辑能力和成本优势。

03. 开源,也是一种进攻

开源不等于退出商业竞争,是换一种方式参与竞争。

对于字节跳动这类平台型公司,开放模型并不是扩大分发的必要条件。它已经拥有一套内部生态,可以独自完成能力的应用、反馈和变现。

以 Seedance 为例。模型发布后,可以迅速进入即梦、剪映等创作工具。用户从脚本、分镜、生成到编辑、导出,都不必离开同一套产品;生成的内容还可以继续进入抖音、红果和 TikTok 的内容场。

一位 AIGC 从业者曾向「定焦 One」概括字节跳动的优势:番茄提供 IP,即梦、剪映等工具完成制作,抖音、红果和 TikTok 承担分发,巨量引擎承接投流。她看到是生产、分发和变现链路同时向一家公司集中。保持闭源,可以将能力优势留在内部,进一步强化不同产品之间的协同。

MiniMax 具备的条件不一样。

与抖音、快手相比,海螺 AI 仍是一款相对独立的创作产品。MiniMax 短期内或许难以补齐内容平台、流量入口和商业化网络,但它换了个方式进场:不完全依靠自有产品触达用户,而是把云厂商、企业服务商、创作工具和开发者变成新的分发节点。

这并非 H3 发布时的临时选择。从 M2、M2.1、M2.5、M2.7 到 M3,MiniMax 持续开放模型权重;H3 只是第一次将这条路线延伸至旗舰视频模型。MiniMax 的财务数据也印证了这条路的分量。

5 月 28 日,MiniMax 披露,过去两个月年化经常性收入(ARR)增长超过 100%;以今年 2 月已超过 1.5 亿美元的基数计算,最新 ARR 已超过 3 亿美元。其收入结构也由 2025 年的 C 端约占七成、B 端约占三成,转为 B 端与 C 端各占一半。同期,MiniMax 服务的全球企业和开发者客户超过 100 万,半年增长 5 倍,全球用户约 3 亿。对 MiniMax 而言,外部平台、企业客户和全球开发者,本就是其增长的重要来源。

图源 / Minimax 官网截图

由此看,"Intelligence with Everyone" 这句品牌口号,慢慢长成了一套商业策略:MiniMax 负责训练基础模型,外部生态参与部署、优化和场景改造,再由 API、企业服务和自有产品承接商业价值。

把几家公司的选择放在一起,是一场典型的非对称竞争。

字节跳动、快手依靠纵向一体化,将模型嵌入自己的产品、内容平台和商业化体系;MiniMax 则横向开放模型,争取成为更多产品共同使用的技术底座。前者追求对完整链路的控制,后者让渡一部分控制权,换取更广泛的分发。

这种差异,也把视频生成推向了下一程。

一位 AIGC 导演向「定焦 One」判断,往后头部模型的能力会越来越接近,用户留存将成为更大的考验。到那时,画质和榜单仍然重要,但不足以定胜负。价格、稳定性、部署方式和工作流适配能力,将更直接地影响用户调用与企业采购。

开源也并非没有代价。权重开放后,MiniMax 产品侧也许会失去一部分产品独占性,生态创造的价值也可能被云厂商和工具平台分走一部分。因此,判断 H3 开源是否成功,不能只看下载量和社区热度,得看它能否转化为持续调用、企业部署和真实收入。

字节跳动、快手选择把模型变成内部系统的增量,MiniMax 则试图让模型成为外部生态都愿意用的公约数。两条路线尚未分出胜负,但竞争的尺度已经改变:视频模型从 " 比谁强 " 变成了谁能进入更多生产流程,并在那里长期留下来。这条以开放换分发的路,MiniMax 已经走了很久。

* 题图来源于 Minimax 稀宇科技视频号截图。

评论
大家都在看