
作者 | 毕伟豪
编辑|漠影
近几月,AI 视频生成赛道持续升温。7 月 31 日,Seedance2.5 与 MiniMax H3 同日发布;8 月,阿里发布 Wan3.0;进入 9 月,智象 HiDream-O1-Video-1.0(下文简称 HiDream V1)发布并冲上权威榜单全球前四。

其中,智象作为创业公司进入这一竞争区间,也意味着全球视频模型的头部牌桌上,除了大厂和上市企业,开始出现新的玩家。
几轮密集上新的背后,AI 视频生成也逐渐从单一的内容创作走向影视、广告、电商等诸多生产场景,与此同时,行业竞争的重点也开始发生变化。
除了对画质、时长和人物一致性等方面的基础要求,模型对复杂运动、物理规律等真实世界的理解,正在成为新的竞争维度。随着视频模型开始处理越来越复杂的动作、空间关系和物理规律,视频生成也成为当前探索世界模型的重要路径之一。
9 月 15 日,智象(HiDream.ai)发布了原生全模态音视频生成模型 HiDream V1,其图生视频能力在 Artificial Analysis 排名第 4,在 Arena.ai 的图生视频模型榜单中排名第 8,双榜前十,跻身全球视频生成模型第一梯队。

这款模型的发布,不仅宣告了智象的原生全模态世界模型矩阵路线完成闭环,也在产业角度标志着智象正式跻身视频生成的核心决赛圈。
一、听得懂人话,也敢不凑时长
现如今,人们使用视频生成工具的常规姿势,是把提示词写详尽:镜头、光线、动作、时长一项项交代清楚。但真实场景里,撰写专业提示词存在门槛,用户给模型的输入常常只是一句口语、一个模糊的念头。
在这种情况下,模型能否根据用户偏口语化、细碎、模糊的输入理解意图并生成视频,变得尤为重要。
HiDream V1 的解法是,在生成前先通过多模态意图理解模块分析用户需求,再调用多模态理解模型进行结构化规划,规划字段覆盖人物、动作、镜头、光影、台词、声音等关键信息,将一句自然语言需求拆解成可执行的分镜信息后,再进入联合生成。
其中,时长也是规划的一部分。多数模型的生成时长由提示词预先设定:输入 5 秒,模型就在 5 秒窗口内完成内容,动作即使没有结束也只能压缩处理。
HiDream V1 则让模型根据内容自行规划时长,结合事件展开、动作完成和叙事节奏决定生成长度,原生支持 5 — 20 秒任意时长生成。这样一来,时长不再只是固定参数,而会根据内容同步变化。
在此基础上,1080p 高保真输出保障单镜头画质,为连续叙事提供基础。视频生成也由单纯的 " 按提示词生成画面 ",进一步走向 " 理解用户意图后组织完整镜头 "。
为了检验这套机制在真实输入下表现如何,智东西用三个场景做了实测。
首先来测试一下意图理解能力,我们用语音输入的方式提供了一段简单的提示词,并附上了一张从故事的中途切入的参考图,看看 HiDream V1 会怎样编排镜头。

能看到 HiDream V1 在生成视频时,根据参考图截取了故事情节,然后精确还原了人与狗的动向。同时在一些细节上,比如男生摸完狗以后手臂搭在腿上,起身时身体微微前倾和打晃等,透露出疲惫姿态。
接下来,我们输入了一个非常短的提示词,来测试 HiDream V1 动态调整时长的能力,提示词和参考图如下:

最后再来看一下 HiDream V1 在音画一致性上的表现,我们提供了一张参考图和一段说唱舞台的提示词,并且在提示词中的台词部分故意漏掉了一个字,提示词如下:
生成一段约 10 秒的真实嘻哈音乐节现场。一名年轻说唱歌手站在大型舞台中央,手持麦克风高能说唱,穿大众街头服装,巨型 LED 屏幕播放动态,视觉舞台灯光跟随鼓点变化,台下观众挥手欢呼。镜头结束场景紧随歌手前方移动,再切到近景捕捉表情、口型和嘴巴,最后拉远表演整个舞台。歌手说唱一首原创歌词:" 低轰进胸口,今晚就看谁先出手。" 要求中文说唱节奏明显,咬字充足,口型与歌词准确同步;鼓点、贝斯、歌声、灯光和人物动作保持同步,随着说唱逐渐推高现场情绪,最后以观众欢呼和音乐高潮结束。
可以看到,HiDream V1 在音画同步方面做得相当不错,人物的嘴型和歌词都一一对应。HD-V1 还把我们所提供的残缺歌词进行了补全," 低音轰进胸口 " 这句歌词非常清楚,并不是含混的略过。
二、从生成动作到理解运动规律:一句话生成超燃百米飞人大战、NBA 绝杀
视频是人类观察动态世界最直接的方式。视频模型要跨过的分水岭,是让画面里的运动符合真实世界的因果。
比如,人在跑步时肌肉会颤动,篮球出手后会划出抛物线,手部施力会影响线的走向。让物体动起来,和让它按真实规律动,是两件事。
HiDream V1 在生成与叙事规划中进一步强化了对物理规律的建模:物体在重力下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续等等。
关于这部分能力,智东西进行了三次测试,其中两个测试为多人运动场景,一个是细致的手部动作生成。需要观察的是模型面对动作描述和参考图片,能不能生成符合现实规律的完整运动过程。
首先,我们从精细的手部动作切入,选择了 " 拧螺丝 " 这一需要双手协作的场景,让一只手固定螺丝,另一只手使用螺丝刀旋转,将螺丝逐渐拧入木板,观察模型能否处理手、工具和小型物体之间的精细空间关系。

第二个测试,我们根据 NBA 比赛最后时刻的三分绝杀场景,做了一张参考图,并附上提示词,看看 HiDream V1 在这种人物繁多的情况下,能否生成符合物理规律的视频。

最后一个测试是奥运会百米飞人大战。我们设置了 8 名运动员同时起跑的场景,从发令、起跑,到中段逐渐拉开差距,再到最后两名运动员几乎并肩冲刺,观察 HiDream V1 能否处理多人同时运动时复杂的空间关系,以及不同运动员之间速度变化和相对位置的变化。

三组测试分别从精细操作、多人运动和复杂运动三个层面进行了验证。可以看到,HiDream V1 能够很好地持续维护人物、物体和空间之间的关系。
支撑这些能力的,是智象" 先规划、后联合生成、再以多模态 Reward 对齐 "的技术思路:先在全局层面规划叙事与角色状态,再在联合生成中约束画面、动作与语义,最后用多模态奖励信号对齐画质、连贯性与物理合理性。
在后训练阶段,智象采用 Diffusion RL 技术,并设计与人工认知对齐的多模态 Reward 模型。这套训练链路的背后,是 DMSampler、DiffusionCompass、EvoID 三篇论文,从扩散强化学习采样效率、生成质量控制和身份保持等方向为模型研发提供技术支撑,分别收录于 2026 年 ICML、ECCV、CVPR 三大顶会。

从实测来看,这种能力变化体现在了具体的视频生成任务中,模型需要理解的不再只是某一帧画面,还有人物如何运动、物体如何变化,以及一个动作发生后会带来怎样的结果。
对于视频生成而言,这或许也是其走向世界模型的重要特质。
三、不止路线图:一个 UiT 底座,四大模型的体系化落地
HiDream V1 的意义不只是新增一个视频模型,更在于它进一步补上了原生全模态世界模型矩阵中的 Video 一环。围绕这一统一底座,智象已经形成了图像、视频、3D、具身四个模型方向。
图像解决视觉生成与理解,视频进入时间维度,3D 对应交互式环境,具身进一步深入真实动作与具身反馈,四个模型分别对应着四个观察世界的切面。


智象(Hidream.ai)联合创始人兼 CEO 梅涛在谈论智象的路线时坦言:" 智象致力于构建‘一个原生全模态底座、四大模型同源演进’的模型矩阵。我们所构建的,不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化、走向可落地的原生全模态体系。"
HiDream V1 发布后,原生全模态世界模型矩阵路线的闭环,让智象在全球世界模型探索中,进一步形成了从视觉生成到真实世界交互的完整能力布局。
结语:中国 AI 视频生成,再添一股全球竞争力量
从整体实测效果来看,HiDream V1 于各类复杂场景中,在连续动作、人物关系、物理规律以及音画同步等方面的表现可圈可点。
尤其是在篮球绝杀和百米飞人大战的视频中,HiDream V1 体现出了极强的预测能力,仅通过一张图片就生成了后续场景,而且物理定律并没有崩坏。
这一点能够反映出视频生成和世界模型路线的一个切口,视频所记录的是现实世界不断变化的过程,而当模型能进一步理解时间、空间、物理规律以及因果关系,视频生成所覆盖的能力边界也会随之不断扩大,逐渐成为模型理解和模拟真实世界的一种路径。
HiDream V1 的发布,不仅是智象在视频生成领域的全新进展,也让其 " 一个原生全模态底座、四大模型同源演进 " 的模型矩阵布局真正显现出来。


登录后才可以发布评论哦
打开小程序可以发布评论哦