作者:呋辛酯
编辑:努尔哈哈赤
近期,AI 视频生成赛道又有了诸多新动作:
7 月末,稀宇科技 MiniMax 发布全模态模型 H3,实现文本、图像、音频、视频的统一理解与生成,最高可输出 2K 分辨率、最长 15 秒带原生立体声的视频,并在第三方评测 Artificial Analysis 所有类视频模型榜单上均居于全球前三。
同日,字节跳动推出 Seedance 2.5,单次即可生成 30 秒高质量视频,支持多轮延长。其多模态参考能力也全面升级,可最多 50 个素材同时输入,并支持精准的时间戳控制,可定向编辑视频。
8 月,Sand.ai 正式发行其统一音视频生成模型 MAGI-2 Preview,不仅在 Artificial Analysis 图生视频模型榜单中拿下第六,其生成成本更仅有行业主流模型的十分之一。阿里也紧接着开启 Wan3.0 的公测,单次生成时长延长至 30 秒,且除了文本、图片、音频、视频四种模态之外,还可支持 doc、ppt、pdf、md 等文档格式输入。
更关键的是,MiniMax 与 Sand.ai 还相继将全新模型对外开源。加上更低的生成价格或将大幅拉平行业底层技术水平,让业界拥有可本地化部署、接近头部闭源水准的视频基座,堪称 AI 视频模型赛道技术平权的 "DeepSeek 时刻 "。
而随着底层模型能力差距渐趋缩小,未来行业的竞争或将不只停留于参数纸面、跑分画质的表层比拼,博弈的重心正下沉至产业链中间环节—— AI 视频创作工具。它们承担承上启下的角色,把晦涩的底层模型能力封装为可落地使用的产品,将 AI 碎片化生成的原始片段,打磨至满足工业交付标准的商业内容。
但矛盾也由此凸显:底座能力差距快速收窄,手握模型的上游厂商还在亲自下场抢占应用层市场,中游工具平台的生存壁垒究竟在哪里?为此,雷报不完全统计了国内 53 家主流 AI 视频创作工具,并依据其技术底座与运营模式,大致划分为模型自研派、生态大厂派、整合系统派、垂直深耕派四大阵营,下文将逐一拆解各阵营的竞争现状、核心矛盾与发展趋势。
卷不动、退不了,模型自研派靠什么活下去?
模型自研派的核心玩家包括字节、快手、阿里、MiniMax、生数科技、爱诗科技、智象未来等。
自研模型能力依然是行业最硬的底牌。2026 年 2 月,字节 Seedance 2.0 上线后几乎改写了国内市场格局,按日消耗占比计算,Seedance 已占据市场超八成份额。掌握自研模型底座的厂商,往往具备赛道核心竞争话语权,整个行业的技术天花板、成本底线、效果上限,也基本上仍由这一类公司决定。
不过,行业逻辑正在快速改变。头部模型厂商的重心已从 " 刷跑分 " 逐步转向 " 落地干活 ",纷纷向下游工具层渗透,AI 视频工具不再只是展示模型能力的窗口,而是被整合包装成创作者真正能用且好用的工作平台。
2026 年 8 月 5 日,字节即梦 AI 在接入 Seedance 2.5 之外,适配了白模素材参考能力,同步接入了 Maya/Blender 插件、智能编辑模式等多个专业创作工具。小云雀 AI 也扩充了角色动作库、相机运镜库,上新角色体系库等功能,同时发起故事大赛激励计划。
其他模型厂商也在跟进:阿里于 5 月推出万镜一刻平台,将阿里全系自研模型打包成覆盖全链路创作方案,以适配短剧创作、动漫制作、广告营销等具体落地场景;稀宇科技推出多模态智能体 MiniMaxHub,打通灵感梳理、Agent 执行到审核交付的全流程;生数科技 Vidu 针对音乐 MV 场景升级一键 MV 功能;爱诗科技与芒果传媒建立战略合作,押注产品化和商业化落地;智象未来帧赞近两月密集更新字幕擦除、多角度生成等创作细节功能;商汤近日发布的 Seko3.0 除强化内容生产能力外,还以 OPC 线下产业基地和全球发行生态,打通内容落地的完整路径。
模型本身的突破已远远不够。如今的头部模型研发商,正在将视角延伸至整个 AI 内容产出的工作流程,思考从生成细节优化到内容生态协同的每一个环节。
当然,自研派的内在矛盾也相当突出。
头部模型竞赛还在继续,但技术壁垒正在快速变薄。Seedance 2.0 到 2.5 的体验跃升,已远不如 2.0 上线时那种 " 降维打击 " 式的震撼。与此同时,诸如如商汤、智谱等更多非头部自研厂商 , 正面临越来越大的投入产出比压力。头部模型的快速迭代不断抬高追赶成本,继续重金投入自研基座已未必划算,掉队风险正在加剧。
而字节、快手、阿里依托自身在内容分发、消费服务、企业服务等核心场景的长期积累,将自研大模型与自有工具、平台生态深度打通,形成了 " 模型 + 场景 + 渠道 " 的自我闭环,商业通路远比其他自研厂商顺畅。两相对比,模型层的集中化趋势已不可逆转,最终能留在牌桌上的基座模型厂商,大概率不超过三到五家。
对自研派而言,竞争早已不只是参数内卷,而是谁能把模型能力转化为稳定、低成本、可复用的产业工作流。其余玩家只有两条路:要么退居 " 模型调用层 ",靠工作流和行业方案构建差异化;要么在垂直领域做深,避开通用模型的正面战场。
影视寒冬催生 AI 刚需,但生态大厂的工具答卷及格了吗?
第二阵营是腾讯视频、爱奇艺、B 站、芒果超媒这类视频平台,以及阅文、中文在线、掌阅等网文平台。与模型自研派不同,它们普遍缺乏顶尖的自研大模型,其底牌主要在于手握正版 IP、内容场景、创作者生态和流量分发渠道。
上游影视寒冬的大背景下,真人内容产能骤降,视频平台需要用 AI 补足内容供给、降低制作成本;网文平台面临的则是传统影视化 IP 开发通道收窄,变现机会减少,而 AI 漫剧和短剧提供了低成本、快周转的新变现路径。两类平台虽然动因略有差异,但本质一致—— AI 视频工具的核心价值在于能否提升内容生产效率、降低供给成本,这是各自内容生态的刚需基础设施。
视频平台中,腾讯视频的布局最为系统:WorkRally 面向专业化漫剧制作团队,以 AI 导演智能体为核心,打通剧本解析、分镜生成到成片全链路;于 7 月启动内测的 WorkSolo 则面向大众创作者,涵盖了短剧、互动影视等三种创作模式;腾讯混元 3D 则瞄准 3D 创作赛道,支持文生、图生 3D 等多种模式。
爱奇艺纳逗 Pro 致力于满足长篇影视作品的创作需求,上线两个月已服务 200 多个不同类型的影视项目,并打通内部生态,用户可将生成作品一键发布至爱奇艺号;芒果灵创由原 " 山海 " 平台升级而来,首发即接入了 40+ 全域模型、70+ 特色功能,满足短剧承制方、大型影视团队、品牌创意部门等不同内容团队的需求;B 站的 Updream 专为 UP 主设计,由华为云驱动,主打轻量化、智能化创作体验。
网文平台同样在工具层发力。阅文在 7 月发布 "Buddy 系列 "AI 智能体矩阵,包括:作家助手 NovelBuddy、漫剧助手 DramaBuddy 和版权助手 IPBuddy, 形成了覆盖内容创作、IP 改编与版权开发的一体化 AI 工具矩阵。中文在线 " 次元神笔 " 集成自研与头部视频生成模型,并走 " 出海优先 " 路线;掌阅的 " 泡漫 " 则探索 " 剧本进、剧集出 " 的一站式 AI 短剧生产工具。
两类平台的目标一致的——将 IP 改编为视频内容的门槛降到足够低,让批量化生产成为可能。但大家面临的困境则有所不同:视频平台面临的困境是当前工具生成的中长篇影视内容仍难以满足平台级专业制作标准,且观众的接受度也相对不高,因此在商业闭环的打通上仍存在不小阻力。网文平台所聚焦的短剧 / 漫剧,在技术层面的问题已基本解决,但并未改变 " 内容过剩时代流量为王 " 的残酷现实,其变现环节高度依赖外部流量平台的投流分发,成本高昂。雷报此前在《一年百亿销售费用,"AI+IP" 只是内容平台的遮羞布?》一文有详细论述。
尽管当前困难重重,生态大厂们对 AI 视频工具的需求正在肉眼可见地变得旺盛。7 月,爱奇艺独家上线了国内首部获得《网络剧片发行许可证》的 AIGC 长片《奇谭:纸刃渡荒墟》,全片时长超 60 分钟,站内热度超 5300。安徽卫视则成为国内首个播出 AI 剧集的省级卫视,20 集 AI 古装剧《桃花潭记》登陆晚间档并引发网络热议。芒果 TV 则上线刘慈欣监制的首部 AIGC 科幻短剧《神 · 笔》,并于 6 月推出全新 AIGC 频道。
不难发现,AI 影视内容正从 " 概念验证 " 加速走向 " 规模化落地 ",并正式进入主流内容体系。
对生态大厂而言,内容形态的演进正在倒逼工具能力的升级——需求端越旺盛,对工具在稳定性、可控性和工业化生产适配性上的要求就越高。作为 AI 视频工具行业最大的落地场景,生态大厂派的需求刚性将持续增强,而率先跑通工业化生产工作流的平台,也有望在这一轮内容供给升级中掌握主动权。
当 " 发动机厂 " 也开始 " 造车 ",整合系统派的不可替代性究竟在哪?
第三阵营是中游工具平台的主力军,包括 LibTV、万兴剧厂、AniShort、Flova AI、TapNow、Shotlab 等创作系统整合类公司。这一类玩家最大特点就是:不自研大模型,靠聚合多家模型 API,叠加自研工作流和项目系统做产品。它们不拼 " 谁生成画面更好 ",而是拼 " 谁更懂短剧、漫剧工作室怎么干活 "。
在真实产业里,AI 生成只是其中一步,真正耗时间、耗人力的是剧本流转、分镜管理、角色资产复用、批量出片、版本管理、团队协作、成片出海适配等种种环节。
此前接受雷报采访时便表示," 大模型是发动机,工作流是整车厂,用户买的是车,不是发动机。" 大模型提供的是单点生成能力,而一部可以商业化变现的成片,需要经历一系列环节,这些环节之间的衔接、调优和品控,是大模型覆盖不到的盲区。而且," 这些数据全部在我们这里沉淀,未来会成为非常重要的竞争资产。"
因此,整合派的价值,就是把这些零散环节打包成一套符合创作者真实需求的,完整、好用、可量产的工作台。
这也是为什么 LibTV 上线仅两个多月,收入已达上线首月的 13 倍以上,母公司演语科技的 AR(年经常性收入)超 3 亿美元。此外,据彭博最新报道,演语科技已开始筹备香港 IPO 事宜,且新一轮估值 30 亿美元的融资完成在即。相关消息还显示,至今年年底,其 ARR 至多可达 7 亿美元。这个数字,已超过可灵当前的 5 亿美元 ARR。
但整合系统派的生存焦虑也相当大。
第一,技术空心化导致盈利模式脆弱。没有自研底座,整合派的商业模式本质上是做模型能力的 " 中间商 " ——向下游创作者提供工具,向上游模型厂商按 API 调用量付费,赚取差价。这意味着它的收入和成本高度同频,且与创作者的诉求存在天然对立:创作者希望一次出片、减少消耗,平台则希望用户多次 " 抽卡 "、增加调用。夹在中间的整合派,向上要承担不断波动的 API 成本,向下要面对终端用户对价格的敏感度,利润空间被双重挤压。
第二,上游模型厂商直接切入,带来极强替代风险。当前字节、快手、MiniMax 等具备自研模型能力的厂商,纷纷下场推出自有工具,直接切入整合派的核心业务腹地。这类厂商不仅内部调用成本更低,还能实现模型迭代与工具功能同步升级,整合派往往还在等待外部 API 更新,上游平台已率先落地最新能力。
加之当前 AI 视频工具核心功能同质化严重,新功能复制门槛低,大量中小工具仅为界面 " 换皮 ",几乎不具备不可替代性。一旦上游厂商补齐工作流与场景化能力,中游大量套壳平台将快速失去生存空间。这也是为什么今年以来不少 AI 视频工具平台都在高频更新。这种 " 快 " 往往是被迫应对行业变化的防御性动作,而非主动构建差异化的进攻策略。
未来该阵营或将迎来一轮明显洗牌。但整合系统派并非没有出路,其出路仍在于其核心能力本身,即能否在 " 懂行业怎么干活 " 这件事上建立起模型厂商无法快速复制的壁垒。这要求相关平台不能只做一个更好的视频生成器,而是深度嵌入未来内容生产的协作生态之中,向上链接出品方、制片方、发行方,向下链接广大创作者,让制片方找到合适的创作团队、让创作者获得项目资源和变现渠道——成为链接行业上下游的关键节点。
大厂围猎、赛道收窄,垂直玩家要如何守住自己的 " 一亩三分地 "?
第四阵营是在通用视频生成之外选择窄口径切入的垂类深耕玩家,分布在动画创作、3D 生成、数字人视频、电商营销等细分领域,包括 OiiOii、Hyper3D、Tripo AI、魔珐有言、潮际好麦 AI 等公司。
通用 AI 视频工具能覆盖多种场景,但在专业连贯动画、高精度 3D 资产、企业级数字人内容等纵深领域,往往因缺乏行业 know-how 和数据积累而难以达到工业级交付标准。这正是垂直派的生存空间。
其中,OiiOii 是全球首个专注于动画创作的 AI Agent,其 " 以交付动画成片为目标 ",模拟真实动画公司的分工协作模式,内置了 7 个专业 AI Agent,各自扮演不同角色,协同完成从创意到成片的全流程,并拥有上百种经过调优的动画风格。据悉,OiiOii 目前正在启动新一轮融资。
3D 生成模型与大语言模型、视频生成模型分属不同的技术赛道,但其落地场景与视频领域有较多重合,市场规模也相对较小(Precedence Research 数据显示,2025 年全球 3D 生成式 AI 市场规模约 18 亿美元),因此在本文中归入垂直深耕阵营。
其中,影眸科技核心产品 Hyper3D 以全球首个千万面级 3D 生成模型 Rodin 为核心,面向专业创作者提供便捷的 3D 生成工具。今年 6 月,影眸科技宣布完成了一轮数亿元人民币的融资,且新一代模型上线首月便推动订阅用户与 ARR 环比暴增超 400%;VAST 是该赛道的另一家明星公司,其在今年 7 月完成超 1.5 亿美元的 A3 轮融资。截至今年 3 月,旗下平台 Tripo AI 便已服务全球超 650 万名创作者和 9 万名开发者,累计生成 3D 资产数量超 1 亿个。
垂直派的优势在于专业壁垒高、产业绑定深,但由于细分市场容量有限,其赛道天花板天然低于通用赛道。
比市场规模更直接的挑战,来自模型能力的持续外溢与模型派工具的加速渗透。头部视频大模型正不断扩展生成边界,在 3D、动画、数等方向上的精度和可控性持续提升。这意味着垂直派不仅要面对细分赛道内的专业竞争,还要时刻警惕通用工具从侧面 " 包抄 " 的风险。一旦通用大模型在某个垂直方向的精度和可控性达到工业级标准,相关垂直玩家的生存空间可能被瞬间挤压。
而在 3D 生成这类相对独立的赛道上,则由于头部大模型厂商的悉数布局,导致本就空间不大的垂直赛道竞争异常拥挤,留给独立玩家的窗口期不会太长。例如,字节跳动发布新一代 3D 生成大模型 Seed3D 2.0;腾讯推出混元生 3D API 及混元 3D 世界模型 2.0 并开源;阿里旗下高德发布 3D 原生城市世界模型 ABot-Earth0.5。
因此,垂直玩家的护城河,显然不在于宣称 " 全能 ",而在于把特定场景做深做透。从单一工具向更深的垂直场景延伸,在具体行业中,沉淀出通用模型难以快速复制的流程理解与交付能力,并由此实现深度的产业绑定。
结语:
纵观四大阵营不难看出,行业竞争格局仍远未定形。仅就中游 AI 工具层来说,各细分赛道均有各自的切入机会与结构性难题,尚无哪一类玩家通吃全局,也暂不存在一套已被验证的通用解法。
但整个行业的趋势已经非常清晰:AI 视频早已走出 " 比拼样片效果 " 的初级阶段,正式进入工业化交付竞争。模型能力正在快速普惠化、基础设施化,未来真正拉开差距的,不是谁的画面更惊艳,而是谁能真正理解产业端的需求,更稳定、更低成本、更可控、更规模化地完成 " 商业化成品 " 交付。
而在本文梳理的 53 家中游工具平台中,不少仍停留在概念验证、套壳调用的浅层阶段。随着技术红利收窄、资本趋于理性,行业留给入局者折腾的空间和时间都在快速缩减。能够在这场洗牌中存活下来的,注定不会是追热点的投机者。


