时代财经 08-03
告别“脸崩”时代!AI视频生成模型竞赛加速,谁在为技术买单
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

本文来源:时代财经 作者:吴典 林心林

图片来源:视觉中国

这个夏天,AI 短剧赛道杀出一匹 " 黑马 "。

近期,一部总时长约 73 分钟的短剧《被裁掉的女孩》" 出圈 ",引发网友热烈讨论。该部短剧于 6 月上线,并于 8 月 1 日更新第二季。截至 8 月 2 日,该剧抖音平台播放量达到 2.4 亿,男女主角更是相继开通账号,以 Vlog 等形式与粉丝互动,被称为首批 AI 网红。

时代财经注意到,《被裁掉的女孩》聚焦于小镇女孩奔赴大城市追梦,不断蜕变的成长历程,故事题材不算新颖,但 AI 技术的成熟应用为其增色不少。不同于早期短剧脸崩、肢体扭曲、塑料质感的观感,该短剧中的人物微表情十分细腻,不同情绪都可通过面部、瞳孔、眉头变化等方式层层递进,不再是刻板的 AI 模板脸,刷新观众对 AI 短剧的认知。

某种程度上而言,这是 AI 视频生成技术向前跃进的缩影—— AI 不再是噱头,而是已经真正融入内容创作。当前,大模型赛道百舸争流,行业普遍认为视频生成模型正从内容生成走向理解世界,且随着模型对物理规律理解能力的增强,其应用边界将进一步扩大。

带着商业落地场景,各大模型扎堆 " 上新 "

过去几年,以 ChatGPT 为代表的大语言模型推动人工智能完成了一次重要跃迁。此后,图像生成和视频生成的多模态模型也快速发展,AI 产业化落地走进 " 深水区 ",尤其是在视频应用赛道。

回溯来看,早期 AI 视频大模型多以数十秒短视频素材生成为核心,侧重于短视频特效、图片动态化等轻量化场景;现阶段,行业攻克了人物一致性、长时序叙事、画面连贯三大核心难题,正式具备短剧、品牌宣传片、电商内容、动漫剧集等长链路内容生产能力。

比如 7 月," 独角兽 " 企业智象未来(HiDream.ai)推出 Vivago R1 多模态创作智能体,其可生成任意连续时长视频,同时具备长链路叙事规划能力,统一画面风格、人物设定与叙事逻辑,缓解长视频生成时出现的画面跳变、人设割裂等问题。

再比如,MiniMax 正式发布的通用全模态生成模型 H3,可输出原生双声道音视频,最高支持 15 秒 2K 分辨率视频生成;字节跳动推出的 Seedance2.5 可单次生成 30 秒高质量视频片段,并支持多轮延长。

不同于以往的参数比拼,这些大模型的面世还都伴随着一个极为鲜明的特点——把商业化落地路径讲明白。

据时代财经了解,H3 主打商用级多场景内容生成能力,2K 分辨率下每秒价格不到主流模型的 1/3,768P 分辨率下每秒价格不到 1/2;Seedance2.5 则已与徐工集团、小鹏汽车、灵初智能等多家企业确认合作,开始进入工业制造、具身智能等更广泛产业场景。

智象未来则提出 "1+1+3" 的商业模式。其创始人兼首席执行官梅涛向时代财经表示,公司以 HiDream 系列大模型为底座,构建 Token Hub 平台提供标准化模型能力输出,并在此基础上围绕商业营销、影视创作、内容创作三大场景,实现 AIGC 产品创新。

截至目前,智象未来的产品服务范围已经覆盖全球 100 多个国家和地区,拥有超过 4 万家企业客户以及超过 5000 万 OPC 用户,Token 月消耗量超 4 万亿。

" 今年以来,大家都能明显感到,大模型的发展速度已经不是线性增长,而是爆发式增长。" 梅涛在谈到大模型发展进程时感叹,今年头部 AI 大模型公司无论在用户规模、收入增长,还是模型能力上,都进入了加速阶段," 可以说是狂飙突进 "。

行业高速迭代,但绕不开算力、算法、数据三大底层考验

对话中,梅涛回顾了大模型的技术发展路线。他直言,2022 年 ChatGPT 让通用大语言模型真正 " 破圈 "。随后,图像生成和视频生成快速发展,从 StableDiffusion、Midjourney、DALLE,到 Sora、Veo、Seedance、可灵 AI、智象未来 HiDream,整个多模态生成赛道进入高速迭代周期。

近两年,大模型开始分化,双线并行:一条是沿着基础大语言模型和推理模型持续演进,比如更长上下文、更强推理、更强代码能力、更强 Agentic 能力;另一条则是多模态模型向世界模型演进,即 AI 不再只是理解文字,也不只是生成图片和视频,而是开始建模空间、时间、动作、物理规律和因果关系。

梅涛选择押注世界模型,他认为纯文本只是信息的一种载体,而多模态天然包含图像、视频、音频、动作和物理世界信号,更接近 AGI 的入口。

一个现实情况是,当前行业对世界模型还处在探索期。在生数科技联合创始人、首席执行官骆怡航看来,世界模型并非一个全新概念,随着视频生成、多模态模型和具身智能快速发展,它正在从学术研究走向产业中心。

骆怡航指出,语言模型主要处理人与语言、知识和信息之间的关系,而世界模型面向的,是智能体与整个世界的交互," 如果只依靠大语言模型理解世界,相当于只使用了人类智能中很小的一部分,大模型时代还需要一个达到 LLM 范式级别的世界模型 "。

对于世界模型搭建的技术难点,骆怡航向时代财经表示:行业所有从业者都绕不开算力、算法、数据三大底层考验。

其中,算力短缺是国内 AI 大模型研发所面临的共性难题,制约着视频与世界模型的训练、推理全流程;在算法层面,相较于发展较为成熟的大语言模型,AI 视频生成乃至世界模型尚未形成固定最优技术路线,架构、算子、推理策略仍处在持续创新迭代阶段。

据汇生国际资本总裁黄立冲估算,国内模型大厂的编程完善时间要比美国慢半年,且中国的算力分配不一样,未来算力紧缺会更严重。

他以 KimiK3 举例,企业若想要落地部署 KimiK3,开展常态化商用,算力配套至少需要投入 2000 万元至 2500 万元。目前由于算力不足、模型复杂尚未调优,导致同等工作任务,KimiK3 所需耗时要高出行业标准 3 至 5 倍," 算力成本可能比美国同行高,模型倒是不错的 "。

数据则是搭建世界模型的最大瓶颈。骆怡航称,行业比拼的并非单纯的数据体量,而是完整的数据治理体系,高质量素材归集、标注、筛选、二次利用整套工程体系门槛极高。当下,不少企业依托具身智能路线研发世界模型,这需要依靠实体机器人采集海量实景运行数据,一旦数据储备不足,模型泛化能力便会受限,仅能适配小众场景,无法走向规模化商用。

" 整体来看,当前全球世界模型发展大致对应大语言模型 GPT-2 至 GPT-3 阶段,还未实现完备的智能涌现与通用推理能力。"

资本买单,过去三个月行业融资规模达百亿

针对上述痛点,各家企业基于自身技术积淀给出了差异化解法。比如生数科技,其在长期的视频大模型的技术积累上,公司逐步构建起一条清晰的通用世界模型战略:以基座世界模型为核心底层,向上延展出贯通数字空间与物理空间的双轨体系,形成面向通用智能的核心基础架构。

目前,该公司的视频生成模型 Vidu Q 系列已渗透漫剧、短剧、广告、电商、动画和影视等内容生产体系中,并于近期发布了 Vidu S1 实时交互模型;世界行动模型方面,其在去年末开源了 Motus,并在今年 4 月推出 MotuBrain,深耕具身智能机器人的通用 " 大脑 "。

骆怡航将这一模式总结为 " 一体两翼 ",即一个技术复用两个空间,且可以相互协同增强," 这是生数(科技)最具特色的地方 "。

这套商业与技术叙事也获得一级市场资本的青睐。今年 7 月中旬,生数科技完成新一轮 5 亿美金融资,是迄今为止国内通用世界模型领域最大的单笔融资。本轮融资落地后,公司短期累计融资规模超 50 亿元。

另据《科创板日报》报道,生数科技或计划在 2026 年上半年启动港股 IPO 流程。工商信息显示,其已于 3 月末完成股份制改造,公司主体由 " 北京生数科技有限公司 " 变更为 " 北京生数科技股份有限公司(未上市)",完成了上市前核心的主体架构调整。

智象未来亦于 7 月完成了一笔 15 亿元的 C 轮融资。算下来,2026 年至今智象未来已经完成三轮融资,累计融资额超 21 亿元,投后估值已突破 10 亿美元。同步完成 C 轮系列融资的还有 AI 视频生成及实时世界模型企业爱诗科技,该轮融资累计总额达 29.8 亿元,公司投后估值超 20 亿美元。

如此密集的融资事件反映出行业情绪之高。据投中网不完全统计,仅过去三个月,世界模型及相关方向的融资金额已达到百亿级别,头部项目估值更是节节走高。

今年 7 月初,巨头快手分拆可灵 AI 独立融资落地,规模近 30 亿美元,这是行业的标志性事件,意味着视频大模型赛道资产价值获得资本市场独立定价,有望加速视频大模型发展进程。

对于这片繁荣景象,黄立冲直言,大模型发展至今,已经来到了人类文明转型的时刻,中国、美国都在不遗余力地加大对算力需求的投入," 美国的 AI 大厂和算力大厂都在极力参与这个竞赛,生怕掉队 "。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 分辨率 时代财经 短视频 字节跳动
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论