21 世纪经济报道记者 岑栩
7 月 31 日,字节跳动旗下新一代视频生成模型 Seedance 2.5 正式发布;针对企业用户,火山引擎将于近期上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能、Xspark AI(无界智航)等多家企业已与火山引擎达成合作意向,将率先接入 Seedance 2.5。在 2.0 版本已进入多个实体产业的基础上,视频生成模型进一步以标准化工具的姿态进入实体产业的核心生产环节,而非停留于内容创作的辅助角色。

(图说:扩展不同桌面布局、不同物体组合、不同视角与光照条件的数据,提升具身智能模型泛化性)
视频生成技术过去两年的进步,主要被框定在广告营销、影视预演等内容产业语境下,其商业价值被定义为降低 " 视觉内容 " 的生产门槛。但 Seedance 2.5 在物理规律真实性、长时序一致性、编辑精度等方面的持续提升—— 30 秒单段原生直出、全模态多素材联合输入、可控生成与二次编辑——指向了另一条商业化路径:作为工业数据合成与流程内容生产的标准化工具,辅助传统仿真建模和实景拍摄环节。
香港科技大学计算机科学与工程系副教授王帅指出,视频本质上是对真实世界在时间维度上的连续表达,一个高质量的视频生成模型如果要生成稳定、连贯、可信的画面,就必须在相当程度上学习物体运动、空间关系、光影变化等物理世界规律。这意味着,视频生成模型正在从视觉表达走向视觉理解。中国科学院软件研究所研究员张立波则认为,当前模型通过海量数据学习,对客观世界规律进行了压缩与重构,但感知和理解能力仍存在局限,未来随着多模态技术迭代,有望实现从浅层到深层的理解能力跃迁。
产业界的行动比学术判断更为直接。小鹏汽车已将 Seedance 2.0 集成至企业内部一站式 AIGC 平台 Vision-X,辅助汽车产品设计、创意灵感快速验证、营销宣传物料制作等环节的视频创作。具身智能公司的接入则聚焦于数据合成——灵初智能基于 Seedance 2.0 扩充模型训练数据集,对光照、背景、纹理、空间布局、物体组合等关键要素进行多样化调整,支撑模型跨环境、跨本体的泛化训练;微分智飞通过生成复杂环境穿越、障碍物闪避、室内自主寻路等长尾飞行数据,优化飞行机器人的运动轨迹预测能力;Xspark AI(无界智航)则把 Seedance 2.0 作为其具身数据生成工具 X-Gen 的关键能力模块,将数据生产方式升级为 " 真实数据打底 + 合成视频扩展 + 动作标签映射 + 评测回流优化 " 的数据飞轮。这些合作的核心逻辑是一致的:用生成补充采集,用算法辅助人工建模。

(图说:小鹏首届 AI 公开赛获奖作品,团队基于 Seedance 2.0 生成的未来概念智能座驾)
降低数据合成成本
在机器人训练和自动驾驶模型迭代中,数据的获取成本长期是制约行业规模化的关键变量。传统路径有两条:一是真实采集,需要部署大量传感器和物理设备,覆盖范围受限于硬件成本和场景可达性;二是虚拟仿真,需要工程师手动搭建三维场景,逐一设定物理参数和交互逻辑,单个场景的建设周期以周或月计。
视频生成模型提供了第三条路径。模型只需参考少量高质量的先验数据,即可泛化生成大规模可训练数据—— Seedance 2.5 的多模态输入能力支持同时输入任务指令、环境照片和参考动作视频,直接输出符合物理规律的交互视频序列,无需人工精细建模。在具身智能场景中,该模型可生成透明及反射物体操作、动态导航、多视角协同等复杂训练数据,生成结果基本符合重力、碰撞、摩擦力、机器人关节运动约束等现实物理规律,而这些场景在传统仿真中需要专门编写光学折射和碰撞检测代码。
以透明物体操作为例,机器人学习抓取玻璃杯或金属零件时,需要理解光线在透明和高反射表面的扭曲规律。传统仿真中,这一效果依赖物理渲染引擎的精确参数调校,计算成本高且调试周期长。Seedance 2.5 生成的数据则直接包含这些视觉特征,且可通过条件输入更换环境光照和桌面纹理,一个基础动作可在数千种视觉变体下生成训练样本。
在自动驾驶领域,极限工况和 Corner Case 的数据覆盖是行业公认的难题,多家智能驾驶头部企业正在探索基于 Seedance 模型生成智能驾驶训练数据。暴雨、大雾、降雪等极端天气,以及光线反射、复杂交互与碰撞风险等场景的真实采集,不仅成本高昂且存在安全约束。Seedance 2.5 的可控编辑功能使工程师能够精准调整天气、车流密度、行人行为等变量,系统性构造训练集和评测集。其 30 秒单段生成时长已可覆盖复杂路口通行、变道并线等完整决策片段,使合成数据具备端到端训练价值。
王帅对此分析认为,当视频生成模型具备更强的物理规律理解能力后,其应用边界会进一步扩大,不仅服务于内容产业,也可能成为具身智能、机器人仿真、自动驾驶场景生成、工业设计验证等领域的重要基础能力。张立波则从技术演进角度补充,随着感知维度拓展和多模态迭代,模型有望在持续的交互反馈中建立对世界的动态建模。
从成本结构看,视频生成合成数据的边际成本趋近于算力消耗,而传统仿真和真实采集的边际成本则相对固定。这意味着,对于需要大量多样化样本训练数据的行业,视频生成模型的替代效应将随算力成本下降而加速显现。当前行业面临的限制主要在于生成结果的物理一致性——模型输出的视频序列是否完全符合真实物理规律,仍需人工抽检和验证。但随着模型能力的持续迭代,这一验证成本有望逐步降低。
简化企业内容生产流程
视频生成模型在实体产业的第二类应用,集中在企业内部知识传递和标准化内容生产。制造业、能源、交通等行业存在大量操作手册、培训视频和安全警示教育内容的生产需求,传统制作流程包括脚本撰写、现场拍摄、剪辑、多语言配音,成本在数万元至数十万元之间。
Seedance 2.5 的全模态联合输入能力允许企业将 CAD 图纸、产线实景照片、工艺 SOP 文本作为输入,直接输出标准化操作演示视频。徐工集团已将 Seedance 2.0 应用于工业操作培训、工序 SOP、安全培训等视频生成,大幅降低了传统实拍与 3D 动画的制作成本;面对产品迭代或工艺变更,视频内容可按需快速更新,无需重新组织拍摄或建模。
在石油化工行业,HSE 培训视频和安全警示教育内容的生产具有典型的高成本、高风险特征。全国的油田、炼化及销售公司需要制作大量标准化作业演示和违章警示教育视频。传统实拍模式下,危化品泄漏、火灾等场景的拍摄涉及安全审批和现场管控,部分场景甚至无法实拍。Seedance 2.5 可一键生成 " 事故起因→演化→扩大→处置 " 全过程动态复盘视频,输入事故描述和现场照片即可输出视觉化复盘内容。这一功能使过去因成本和风险限制无法覆盖的培训场景获得了视频化呈现的可能。
能源交通领域的电网巡检机器人训练同样面临类似需求。无人机和机器人巡检需要大量不同光照、天气、地形条件下的训练数据,真实采集受限于巡检周期和设备部署范围。Seedance 2.5 可用于训练数据生成和仿真环境设计,为巡检算法提供覆盖更多环境变量的测试素材。
航空公司的教培模拟场景、化工和农业场景的培训与营销,均属于同类型需求——标准化操作流程的可视化呈现。Seedance 2.5 的可控生成与二次编辑能力,使企业能够将生成内容沉淀为可复用的 " 工艺视频资产库 ",后续培训内容更新仅需调整输入条件,无需重新拍摄。
王帅指出,随着模型能力提升,视频生成技术有望大幅降低内容生产成本,提高创意验证和产业落地效率。但需要客观看待的是,工业场景对生成内容的精度要求极高,模型输出的操作细节(如阀门开关顺序、工具使用角度等)若出现偏差,则无法直接投入使用。因此,现阶段企业端应用仍以 " 预生成 + 人工校正 " 模式为主,完全自动化的内容生产尚未实现。
从产业渗透的节奏来看,此次与火山引擎达成合作意向的企业覆盖了工业制造、能源化工、汽车、具身智能、智能驾驶等多个垂直行业,合作内容从设计验证到训练数据再到培训内容,涵盖了视频生成技术在实体产业中的主要应用方向。这种多行业同步接入的格局表明,视频生成模型已不再需要逐个行业验证可行性,而是以标准化工具的形式进入企业的技术选型清单。
张立波在分析技术演进方向时表示,未来视频生成模型有望实现从浅层次到深层次的理解能力跃迁。这意味着当前的应用仍处于早期阶段,模型对物理规律的理解深度和生成结果的可靠性仍有提升空间。但对于实体产业而言,即便在目前的精度水平下,其在数据合成和内容生产环节的成本优势已经具备了足够的商业吸引力。
更多内容请下载 21 财经 APP


登录后才可以发布评论哦
打开小程序可以发布评论哦