
编译 | ZeR0
编辑 | 漠影
智东西 9 月 7 日报道,今日,智象未来(HiDream.ai)发布具身世界模型 HiDream-O1-Embodied。基于原生全模态的技术理念,该模型强化了机器人物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。
其发布标志着智象逐步实现了打通图像、视频、3D、动作等模态,贯通理解—推演—执行全流程,构建统一世界模型基座的技术闭环。
模型发布同期,HiDream-O1-Embodied 首次参评具身智能模型评测平台 RoboColiseum,即在核心的 Robustness(扰动适应)子榜单中,以平均分 0.692 的成绩登上榜首。

" 我们相信,围绕真实世界的表达、理解和生成,构建同时具备全模态表达、因果推演与物理世界构建三大核心能力,才能建立完整的世界模型基座。" 姚霆说。
常态化具身智能仿真评测平台 RoboColiseum 旨在构建多维度的系统评测体系,以与真机表现高度一致的仿真评测,帮助开发者识别模型的能力优势与短板,持续迭代提升。
该平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于构建一套结果可信、过程可复现的具身模型评测标尺。
RoboColiseum 基于高保真仿真环境构建,高度还原真实世界。平台围绕四个维度推出 4 类能力子榜、78 个高保真仿真评测任务——指令跟随、空间理解、扰动适应与通用操作,自内测上线以来,已吸引海内外几十款重量级模型开展评测。
在这四个维度中,扰动适应(Robustness)被公认为最具挑战性的一环。它通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。换言之,这不是在实验室的 " 温室 " 里考试,而是在各种 " 意外 " 中检验真本事。

该模型在三项核心能力上进行了创新,让理解更精准、感知更稳健、抗干扰能力更强。
1、语言理解,突破关键词匹配的局限
传统机器人对语言指令的理解往往停留在关键词匹配层面。说 " 把杯子拿过来 " 能听懂,换成 " 给我拿个杯子 " 或 " 杯子递我一下 " 就可能 " 宕机 "。
HiDream-O1-Embodied 覆盖多元动词、句式与表达方式的等价指令空间,不被句式束缚,只锁定意图本身。无论指令如何变换,它都能穿透字面,直达用户的本意。
2、视觉感知,多视角协同,避免 " 一处失灵、全局失效 "
在物理世界中,机器人的视觉通道并非是理想状态。相机位置可能发生偏移,标定精度会随时间变化,单路画面也可能受到遮挡或干扰。
HiDream-O1-Embodied 综合多个视角的信息,让不同视觉通道相互补充,而非依赖某一固定视角。当部分视觉信息出现偏差或暂时不可用时,模型仍能借助其他视角理解场景、判断任务并继续执行,让系统从 " 一处失灵、全局失效 ",转变为 " 局部受限、整体仍可运行 "。
3、高容错机制,在 " 不完美 " 中学会稳定执行
多数模型的训练基于 " 完美数据 " ——清晰的图像、完整的画面、标准的视角。但真实世界从来不是这样。光照变化、画面污损、视野遮挡、信号波动,都是机器人实际运行时可能遇到的日常情况。
HiDream-O1-Embodied 在训练阶段便主动引入多种非理想条件,让模型反复面对不完整、不稳定的信息,并学会从有限线索中作出可靠判断。这样的训练使模型不只追求理想条件下的最佳表现,也更加重视复杂环境中的持续稳定。这种容错能力也不局限于某一种视觉异常。
面对光照、外观和场景变化,该模型能够更灵活地利用已有信息,减少环境变化对任务执行的影响。
对 HiDream-O1-Embodied 而言,真正重要的不只是 " 看得清时做得好 ",更是 " 条件不理想时,依然能够稳稳完成任务 "。

这种 " 在训练中见过足够多不完美 " 的能力,并非凭空而来。它触及一个更底层的命题:模型的认知边界,由它所接触的数据所影响。高质量数据,恰恰是具身训练中最稀缺、也最具决定性的变量。
智象打造了 " 模型 + 数据 " 双驱动的策略。该策略的关键突破口,在于让数据生产本身成为模型迭代的有机一环。为此,智象探索出 " 真实基座 + 生成增强 " 的数据生产范式。模型不再是被动接收数据,而是主动参与数据的创造。
以与诺亦腾的合作为例:其高精度真人动作捕捉数据作为真实底座,智象借助原生全模态能力完成百倍级的数据精细化扩增。基于单段真实动作样本,模型可以生成变体视频:在严格恪守物理约束不变的前提下,切换背景环境、光照条件、物体形态等变量,产出海量多元训练样本。
这一机制的关键,在于模型既做 " 考生 ",也做 " 出题人 " ——它根据自身所需主动生成针对性训练样本,形成数据与模型互相驱动的增长飞轮。最终让 HiDream-O1-Embodied 在面对现实世界的强扰动时,展现出出色的鲁棒性。
结语:原生全模态世界模型矩阵日臻完善
就在不到一个月前,智象刚刚发布了交互式世界模型 HiDream-O1-World,该模型在交互式视频世界模型评测基准 WBench 的 Navi 分榜中以平均分 80.9 登上榜首。
交互式世界模型解决的是 " 理解与推演 ",让 AI 在数字世界中具备对空间、时间、运动与物体关系的完整认知。而具身世界模型解决的是 " 操作与执行 ",让 AI 在物理世界中完成真实任务。两者将形成有力互补,为原生全模态世界模型的发展筑牢根基。
正如智象未来创始人兼 CEO 梅涛博士此前所言,下一代大模型竞争的关键,不在于单一模态能力的增长,而是从单模态走向多模态,并走向原生统一的全模态。
从 HiDream-O1-Image 到 HiDream-O1-World,再到 HiDream-O1-Embodied,智象正将其原生全模态技术在多领域铺展,逐步形成覆盖视觉模型、交互式世界模型及具身世界模型的模型家族矩阵。


登录后才可以发布评论哦
打开小程序可以发布评论哦