作者 | Judy
图片来源丨智象(HiDream)
对每天要出片的创作者来说,AI 视频工具带来的失望往往是同三种:说了半天需求,模型只听懂了一半;画面跑到一半,主角悄悄变了张脸;成片出来了,声音是后期贴上去的,口型对不上。
9 月 15 日,智象(HiDream.ai)发布首款原生全模态视频生成模型 HiDream-O1-Video-1.0(下文简称 HiDream V1),同步宣布完成 C+ 轮融资,投资方为新微资本、交子资本、工银资本。
这款模型正是冲着上面三件事来的。它的到来,也补齐了智象从去年到今年布下的四块拼图。当 HiDream ‑ O1 ‑ Video 上线,智象基于自研原生全模态 UiT 架构的四大模型 —— 图像、视频、3D 交互、具身 —— 首次在同一个技术底座上完成闭环。对创作者而言,视频模型 HiDream V1 补上的,是「用画面讲好一段时间」的关键能力,也是世界模型理解和表达时间变化的关键一环。
另外,一个值得注意的判断浮出水面:在 AI 视频生成这个全球竞争最激烈的赛道上,中国企业已经形成了稳定的第一梯队。智象 HiDream V1 与字节跳动 Seedance、MiniMax H3、阿里万相,正在成为 AI 视频领域的「四小龙」。
基本功拉满:1080P、任意时长、音画同步
HiDream V1 给创作者的体验,可以概括成四件事:高保真画面、1080P 高清输出、5 – 20 秒任意时长、音画同步。前两件,是「不用返工」的底气。
在两项国际权威评测中,HiDream V1 均进入全球前列:在 Artificial Analysis Image to Video Leaderboard(With Audio)上取得全球第 4 名,在 Arena.ai Image-to-Video 盲测评测平台上取得第 8 名。前者以标准化、可复现的基准对全球头部视频生成模型进行系统评测,后者是目前全球主流 AI 厂商广泛引用的第三方参考。
榜单成绩是一方面,更直观的是同题实测中的表现。在相同提示词下,HiDream ‑ O1 ‑ Video 的画面保真度、指令遵循度和人物与视频一致性均有更优异的表现。
我们来看一个案例。在同样的一套提示词下,模型 A 出现了车尾突变车头、logo 漂移、苹果叶片消失等问题。对创作者来说,这些恰恰是最贵的错误 —— 每一处都意味着重新抽卡、重新渲染、重新排期。
上方赛车视频由 HiDream V1 生成
模型 A 生成
「一辆高速赛车以极快的速度从镜头前由左向右疾驰而过。音频:引擎声必须表现出逼真的多普勒效应,从极高音调开始,在经过镜头的瞬间音调显著下降。」
另一个值得关注的细节是时长策略。多数视频生成模型遵循固定提示词路线——用户输入「生成 5 秒」,模型只能在这个时间窗口内填充内容,叙事被迫适应时长:创作者要么为凑满 5 秒硬加一个转场,要么把 20 秒的戏压成 5 秒。HiDream V1 的做法,是把时长决策交还给内容本身。
模型根据事件展开的逻辑、动作完成的周期、叙事推进的节奏自行规划生成时长,原生支持 5 – 20 秒任意时长。5 秒或 20 秒服务于同一个目标:在连贯叙事中交付合理、有真实质感的完整画面。你只需要想清楚要讲什么,剩下的事交给模型。
从「画得像」到「听得懂」
视频生成的真正瓶颈,往往在于模型能否「听懂」用户的意图。
创作者的输入常常是口语化、碎片化、模糊化的——「就那种,傍晚,主角一个人在海边走,风大一点,背景音乐孤独一点」。直接丢给模型,容易出现意图漏解、镜头跳戏、人物漂移与音画错位。HiDream V1 选择「先理解,再生成」:你的一句话,模型先转写为可执行的专业分镜语言和叙事逻辑,再开始干活。
理解越深,规划越稳;规划越稳,后续联合生成越不容易「跑偏」。
第二层差异化是物理规律理解。推一扇城堡木门的力度与门轴摩擦声互相对应,多米诺骨牌在拐角处连锁倒下——画面不只「会动」,更知道「为什么这样动」。
推门视频由 HiDream V1 生成
多米诺骨牌视频由 HiDream V1 生成
HiDream-O1-Video 将物理规律理解嵌入世界模型叙事,让物体在重力作用下的运动轨迹、碰撞反馈、惯性延续和光影衰减,都成为画面生成的底层逻辑。
第三层是音画同步。当前多数视频模型采用的是后期拼接技术路线:先逐帧生成画面,再回头配音配效,声音跟画面很难保持一致。HiDream-O1-Video 采用原生全模态架构,对文本、视频、音频信号进行联合建模——画面运动牵引声音节奏,台词与音效反哺镜头情绪,文本条件贯穿始终。镜头切换时,环境声与配乐随之过渡;人物开口时,口型、气口与情绪同频;物理动作发生时,拟音效果与撞击反馈贴近真实因果。
换句话说,过去要靠后期音效和剪辑完成的工作,模型在生成的那一刻就替你完成了。
支撑这一能力的是大规模带内容标注的音视频预训练数据。丰富的标注将画面语义、声音事件与时序关系绑定,使模型在预训练阶段便学习到「内容—声音—时间」的对应规律。
一次 demo 好看不难,每次出片都稳才难
产品能力的背后需要技术公信力——毕竟「demo 好看」不等于「天天出片都稳」。HiDream-O1-Video 的后训练采用 Diffusion Reinforcement Learning,配合多模态 Reward 模型,对画面保真、叙事连贯、身份一致、物理合理性与音画同步进行联合打分。
三篇顶会论文分别切入后训练链路的三个关键瓶颈,构成「低成本采样—质量锚定—身份保持」的完整技术闭环。
DMSampler(ICML 2026,2026 年 7 月,韩国首尔)针对扩散模型采样成本高的问题提出高效采样方案,降低推理阶段的计算开销,让大规模强化学习训练在工程上变得可行。落到创作者这里,就是出片更快、批量抽卡的成本更低。
DiffusionCompass(ECCV 2026,2026 年 9 月,瑞典马尔默)为强化学习过程提供质量锚定机制——没有可靠的奖励信号,强化学习容易「自己骗自己」,这篇论文解决的是如何让模型在迭代中始终对准真实质量标准。对使用者而言,这意味着今天拿到的第 100 条片子,和第一天拿到的质量基准,出自同一把尺子。
EvoID(CVPR 2026,2026 年 6 月,美国丹佛)则聚焦身份一致性难题,确保同一角色在长时段、多镜头生成中保持可辨识的稳定特征。主角不会中途「变脸」——对做系列内容、品牌片和连续叙事的创作者来说,这一条尤其值钱。
换句话说,HiDream V1 不但有能力做到「demo 好看」,也有同行评审的学术体系作为支撑。在 AI 视频赛道,能做到模型能力 + 权威榜单 + 实测 + 顶会研究四层实证支撑的公司,目前还不多。
一个底座,四种能力:世界模型的拼图闭环
HiDream-O1-Video 的发布,其意义远超一款视频产品上线。
从今年 4 月发布原生全模态世界模型架构 HiDream-O1 以来,智象陆续推出了基于同一 UiT 架构的模型家族:
•图像生成模型 HiDream-O1-Image:商用版 1.5 在 Artificial Analysis 文生图榜单取得中国第一、全球第二,开源版同列第二
•交互式世界模型 HiDream-O1-World:在行业首个交互式世界模型基准 WBench 综合总榜排名第一
•具身世界模型 HiDream-O1-Embodied:在 RoboColiseum 的扰动适应和空间推理子榜单中先后登顶
•视频生成模型 HiDream-O1-Video:Artificial Analysis 图生视频榜第 4、Arena 榜第 8
四条产品线,共享同一个 UiT 底座,在统一架构中同源演进。图像记录状态,视频记录变化,空间提供结构,动作带来交互——它们共同构成「空间理解—时间叙事—三维交互—具身反馈」的完整能力链。
智象创始人兼 CEO 梅涛博士的判断是:原生全模态是走向 AGC 的必经之路。「智象致力于构建『一个原生全模态底座、四大模型同源演进』的模型矩阵。我们所构建的,不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化走向可落地的原生全模态体系。」
在视频赛道,常见的做法是先集中资源做好单一视频模型,再逐步拓展能力版图。这种路径起步更快,但每增加一项能力,也需要补充相应的底层支撑。智象选择从统一架构出发,同步推进四大模型,让图像的状态理解、视频的时间规律和交互的空间结构,在同一底座中彼此打通。从架构完整度看,智象已初步形成能力闭环。
把镜头拉远:中国 AI 视频的全球位置
把视角拉到赛道层面,AI 视频生成的全球竞争格局正在发生结构性变化。
2026 年 9 月的全球市场,音频原生(audio-native)已经成为视频模型的标配能力。字节跳动 Seedance 2.0、快手可灵 3.0、Google Veo 3.1 和 Gemini Omni Flash 构成了第一梯队的四极。而 OpenAI 的 Sora 2 API 在 9 月 24 日正式关闭——这个曾经定义了 AI 视频赛道的产品,最终没有跑出来。
在这张全球竞争图谱中,中国企业的位置比想象中更稳固。Seedance、快手可灵、阿里万相、海螺 AI(MiniMax)、智象——中国公司在画质、音画同步、多分镜叙事和物理规律理解等核心维度上,已经具备全球领先优势。
智象未来的差异化标签是「原生全模态世界模型」——在视频生成之外,更致力于搭建能够理解、表达、交互并反馈真实世界的模型底座。
在产品侧,智象已确立「基础模型 + 智能体」双轮驱动战略,打造了面向商业营销的 HiBurst、面向影视创作的帧赞、面向全球创作者的 vivago 三大产品。据公开信息,旗下内容创作智能体 vivago 全球用户已突破 7000 万,覆盖 100 多个国家和地区。
HiDream-O1-Video 的发布,让智象的世界模型矩阵从「路线图」变成了「可验证的体系」。四大模型同源演进、同一底座、同一套后训练方法论——这套体系能否支撑智象在世界模型赛道持续领先,还需要时间和商业化来回答。但至少在今天,「四小龙」的格局已经落定,而智象是其中唯一从原生全模态世界模型出发、完成闭环的那一个。
— END —


登录后才可以发布评论哦
打开小程序可以发布评论哦