专题:中国国际服务贸易交易会 -2026 中国 AIGC 创新应用交流会
服贸会专题活动 "2026 中国 AIGC 创新应用交流会 " 于 9 月 10 日在北京举办,主题为 " 智启未来 应用无界——从模型创新到场景落地 ",智象未来(HiDream.ai)联合创始人兼 COO 王科出席并演讲。

以下为演讲实录:
尊敬的各位领导、各位来宾,非常感谢主办方的邀请,我是来自智象未来的王科。
我今天分享的主题是《原生全模态重塑 AIGC:视频生成进入 " 单反级交付 " 时代》。
我们先来看一下 AI 的演进趋势。很多大模型包括 Fable 5、GPT5.6,它已经超过了平均的人类的智力,顶级的模型进入到人类的天才区。大模型沿着两条路线发展:一条是基础语言的大语言模型,依据上下文深度思考。国外以 OpenAI、Anthropic、Google 为代表,国内的企业有包括智谱、DeepSeek 等;另一条是多模态大模型,以智象未来为代表。而从多模态路线,从技术趋势来看,正经历一场从多模态到全模态的进化。最终会走向哪里?我们判断,它将走向世界模型,再从世界模型走向 AGI。
通往 AGI,业界存在三条路径:第一条,以李飞飞为首的 3D 原生模型,例如 Marble、HY-World 等;第二条,以具身模型,从 VLA 到 WAM 的架构;我们走的是中间这条路径,即多模态到原生全模态模型,再到 World Model。
智象是全球领先的多模态大模型创新企业。是国内唯一有院士领衔,具备完整的路径和产业经验的多模态的 AI 团队。
我们取得了很多成绩:是开源图片生成模型 TOP1,月消耗 4 万亿 Token,开源模型累计下载数 2 百万次,拥有全球 7000 万个人用户,且主要为专业个人用户;SMB 客户超过 4 万家。
智象打造了原生全模态(UiT)底层架构,实现世界表征的统一。我们身处的世界,本质上是一个多模态的世界。如果想要去 imagine world 的话,一定是以图像为起点。我们常说叫一图胜千言,因为图像定格了世界某一时刻的完整状态痕迹。以静态图像为基点,加上时序便成为视频,加上立体几何便成为空间,再加上操作交互便成为具身智能。因此,我们认为图像是未来世界模型的入口。
UiT 能实现所有模态从原始信号端到端的对齐,实现 any to any,也就是任意输入和任意输出。
基于 UiT,我们构建了 HiDream ‑ O1 原生全模态世界模型矩阵。其中包括图像模型 HiDream ‑ O1 ‑ Image 、视频模型 HiDream ‑ O1 ‑ Video、交互式世界模型 HiDream ‑ O1 ‑ World、具身世界模型 HiDream ‑ O1 ‑ Embodied。
这不是简单的功能叠加,而是从底层打通图像、视频、3D、动作等全部模态,实现从 理解 → 推演 → 执行 的完整闭环。
我们的模型有三份不同赛道的硬核成绩单。
HiDream ‑ O1 ‑ Image ‑ 1.5 图像生成模型,在国际独立评测平台 Artificial Analysis 文生图榜单中,取得中国第一、全球第二的成绩;开源版本也取得了世界第二的成绩。
交互式世界模型 HiDream ‑ O1 ‑ World,在行业首个交互式世界模型基准 WBench,综合总榜第一。尤其在物理规律还原、长时序内容一致性两大核心难点指标表现突出。
具身世界模型 HiDream ‑ O1 ‑ Embodied,在 RoboColiseum 子榜单中登顶。在非理想环境中的稳定性与泛化能力上, HiDream ‑ O1 ‑ Embodied 表现出色。这几款模型分别在各自赛道拿到权威榜单的顶尖位置,这不是单点模型的偶然突破,而是整套 UiT 原生全模态底座体系化能力的集中体现。
为什么我们要在这条路上持续创新?背后是我们对 AI 发展趋势的一个判断。
大语言模型和多模态模型,让 AI 能理解文字、图像、视频,回答 " 世界是什么 "。
但世界模型要再往前走一步——它要回答:
世界会怎么变化?如果我采取一个行动,会产生什么结果?
所以世界模型不是简单的生成模型,它是 AI 的认知内核。它要做三件事:
感知世界状态,推演物理规律和因果关系,然后重构并预测世界。
而智能体是行动载体,负责决策、执行、调用工具、观察反馈,并在反馈中不断修正。
用一句话概括就是:基础模型负责认知,智能体负责行动,闭环反馈负责进化。
有了基础模型和智能体的结合,AI 才能从 " 理解世界 " 走向 " 改变世界 "。
我们不仅在模型上持续迭代,也在形成清晰的商业化增长曲线。
我们打造了 "1+1+3" 全景式商业体系。它的底层是 HiDream-O1 原生全模态世界模型,包括图像模型、视频模型、交互式世界模型和具身世界模型能力。
中间是企业级模型服务平台,把模型能力封装成可调用、可管理、可评估、可交付的平台能力。
上层是三个场景化产品:
面向内容电商和品牌商家的 AI 营销生产平台;
面向影视创作的内容创作协作平台 -- 帧赞;
面向全球创作者的视频创作工具 vivago。
我们不是只做一个模型,也不是只做一个工具,而是以模型能力为底座,以平台能力为中台,以场景化产品实现商业落地。
我们先来看第一个产品,全球首个专业级的 AI 影视创作智能体——帧赞。最近芒果台播出了一个《西游记》的 AI 电视剧,广受好评。未来我们判断所有的 AI 剧都要朝着精品化去做。近期基于帧赞,有创作团队打造了《青铜诡事录》的电视剧,用 30 天的时间制作了 60 集,这是首部 AI 短剧 12 小时登顶腾讯热播的榜首,此外还有像《雨夜突袭》、《决战巨兽》、《热血追击》等精品短剧,已经在各大平台播放。
帧赞是为专业团队而生,覆盖从创意到成片的全链路,包含角色库、场景库、服化道等。凭借画布、专业分镜等功能,能代替现场拍摄。影视制作中,剪辑是一个重要环节。帧赞支持快速搭片,以快速节奏高效输出,同时还可以输出无限创意。另外,在整个制片管理上。帧赞提供全流程项目管理,可以根据预算跟踪每个人的消耗、每个人的效率。而且还能实现资产沉淀,也可以做 IP 运营。整套系统就是为商业落地、为专业团队服务。目前帧赞服务的专业团队超过几千家。
再看商业营销方向。
我们的商业营销智能体 HiBurst,已经覆盖了跨境电商内容营销、媒体运营和应用出海等场景,现在是 TikTok 官方 Top 5 服务商,年生产电商营销视频超过百万条。它可以从脚本生成到剪辑成片一体化生成,可以兼顾个人创作与多人协作,同时能够精细化分镜,以及嵌入平台一键发布。
第三个场景应用,也就是今天要重点介绍的是,行业内首个无限时长内容创作智能体 vivago R1。依托我们 " 基础模型 + 智能体 " 双轮驱动的技术战略,R1 支持用自然语言对话的方式生成视频,一次性就能稳定生成五分钟的高质量内容。
这意味着每一位普通创作者,都能独立完成专业团队级的品质作品,我们称之为 " 单反级交付 "。
在 2024 年 5 月就上线了 vivago.ai,是全球最早一批公开可用的 AI 视频生成产品之一。
今年 5 月,它登顶了 Product Hunt 日榜第一。7 月 20 号,我们在 WAIC 上正式发布了 R1。
而今天,我想向大家宣布—— R1 正式全球上线,同时国内版本‘够搭’也迎来全新升级发布。
当前 AI 视频工具大致有两条路线。一条是画布式工作流,把模型、工具和参数交给用户自己连接调试,自由度很高,但门槛也不低。另一条是 R1 选择的对话式路线——用户只需要用自然语言描述需求,就能自动生成视频,并且在对话中持续调整和迭代。
我们相信,对话是人类最自然的表达方式,也是 AI 最友好的创作入口。所以 R1 坚定地选择 Chat-First,对话优先。
这条路线背后体现了智象的两个产品设计理念—— " 做后 " 与 " 做厚 "。
" 做后 ",是把专业创作者的判断、审美和经验,编码进 Agent 的编排能力里,形成强大的中后台。
" 做厚 ",是构建一个厚度十足的 SkillHub,把抽象的 AI 能力翻译成产品广告、角色视频、故事短片、品牌内容这些真实创作场景,让用户一看就知道能做什么、怎么开始。
整个流程里,用户只需要表达目标,Agent 负责拆解和执行,SkillHub 作为翻译层,自动匹配并编排所需的技能组合,把意图转化为可执行的任务序列。
用户只需要用自然语言描述,就可以自动生成视频,门槛低、成本非常低,而且稳定可控。
最后,我想说,技术能力要持续迭代,离不开产业生态的共建。
智象未来在四个方向进行生态布局。
底层基础设施上,智象对接了火山引擎、阿里云、华为云、腾讯云等云厂商。
互联网营销方面,与 TikTok、SHEIN 等海内外平台深度协同。
影视文旅领域,联动上影股份、湖北长江电影集团等广电影视机构。
具身智能方向,联合机器人企业,打造毫米级物理精度的大规模全模态数据集。
我们不仅有很多国际知名大企业合作,很多中小商家也是非常重要的生态伙伴。我们期待与各界伙伴携手,共同推动原生全模态 AIGC 技术赋能千行百业,共创内容产业的全新未来。
新浪声明:所有会议实录均为现场速记整理,未经演讲者审阅,新浪网登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其描述。


登录后才可以发布评论哦
打开小程序可以发布评论哦