智东西 昨天
国产交互式世界模型上新,文本、图片一键生成3D世界
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

智东西

作者 | 杨京丽

编辑 | 李水青

智东西 8 月 18 日报道,昨天,多模态大模型公司智象未来(HiDream.ai)发布原生全模态交互式世界模型 HiDream-O1-World

该模型支持文本、图像及交互等多模态输入,具备漫游、编辑和交互三大功能。用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。

在第三方交互式世界模型评测基准 WBench 中,HiDream-O1-World 以平均分 80.9 的成绩登顶 Navi 分榜。其中,该模型在物理(Physical)维度获得 73.3 分,位列第一,一致性(Consistency)维度得分为 88.0。

HiDream-O1 搭载智象自研的原生全模态(UiT)架构,在时空一致性与物理一致性上,取得了关键性突破:当镜头推拉摇移时,场景空间的几何结构仍可保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机 " 猜 " 出来的画面拼接。

在实际体验中,用户可以从一段文字或一张图片出发,以第一人称或第三人称视角探索生成场景,并控制角色动作、天气及物体状态。智象未来计划将该模型用于AI 互动影游、具身智能仿真和 3D 场景生产等方向。

针对交互式世界模型容易出现的场景漂移、物体消失和物理失真等问题,该模型将3D 空间信息写入 Memory 上下文,并通过Test-Time Training(TTT,测试时训练)在推理过程中持续调整模型,以维持长时间交互下的空间和物理一致性。

值得注意的是,围绕空间一致性,智象未来与复旦大学联合开展的研究论文《DreamWorld:面向 3D 一致世界建模的几何驱动视频扩散》(DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling)已被国际顶会 ECCV 2026 接收。

项目主页:

https://yanghb22-fdu.github.io/DreamWorld

论文地址:

https://yanghb22-fdu.github.io/DreamWorld/asserts/DreamWorld.pdf

一、评测成绩突出,物理维度位列第一

截至目前,智象 HiDream-O1-World 在第三方评测榜单 WBench 的 Navi 分榜中,以平均分 80.9 的成绩登顶榜首,其中在物理(Physical)维度以 73.3 分位列第一,Consistency(一致性)维度达 88.0 分。

WBench 由美团 LongCat 团队与复旦大学联合推出,是业内首个面向交互式世界模型的系统性评测基准。该基准涵盖 289 个多轮交互案例、1058 个交互轮次,并从视频质量、设定遵循度、交互遵循度、一致性和物理真实性五个维度设置 22 项指标。

WBench 分为 Navi 和 Full 两个榜单。其中,Navi 分榜主要评估空间导航与视角控制能力,考察模型在连续运镜过程中能否准确执行指令,同时维持场景结构与物体状态。

HiDream-O1-World 在 Navi 分榜登顶,并在物理维度取得第一,一定程度上反映出智象自研 UiT 架构在时空一致性与物理一致性上的关键突破。

二、一张图生成可探索空间,角色、天气和场景可编辑

HiDream-O1-World 支持文字、图片和交互操控等多模态输入方式。用户可以输入文字描述,上传图片或简单交互,让模型以此为起点补全周边环境,生成可供后续探索的交互空间。

以室内场景为例,用户上传一张卧室照片后,模型可以根据画面中的空间关系继续生成房间其他区域,并在镜头移动过程中维持家具尺寸、摆放位置和遮挡关系。与单张图像扩展不同,这类生成不仅要补全画面,还需要让不同视角下的场景保持一致。

模型提供第一人称和第三人称两种漫游视角。用户既可以直接控制镜头前进、后退和转向,也可以驱动场景中的角色行走,并调整视角方向。

在潜水案例中,镜头在海底移动时,水面光影、珊瑚纹理和鱼群运动会同步变化;当镜头靠近珊瑚时,模型能够继续生成局部细节,并尽量维持整体场景的稳定性。

此外,HiDream-O1-World 还支持实时编辑。用户可以让角色完成抓取、奔跑、下蹲和跳跃等动作,也可以调度环境变化,如触发降雨、物体坠落等环境事件。相应变化不局限于某个局部区域,模型还需要同步调整场景中的几何结构、光照、材质和物体关系。

在角色生成方面,该模型可处理人类、动物和虚构角色等不同主体。以登雪山场景为例,登山者行走后会在雪地上留下脚印,雪花运动会随风速变化,远处山体轮廓和近处岩石纹理也会随视角移动连续呈现。

场景风格同样具有较大的覆盖范围。除城市街景、自然环境和室内空间外,模型还可以生成幻想世界、二次元动画和 3A 游戏渲染等风格化内容。

三、空间信息写入记忆,动态维护 3D 一致性

长时间保持时空一致性,是交互式世界模型面临的核心难题之一。

传统视频生成模型主要根据有限的上下文,预测后续画面。当交互轮次增加、镜头运动范围扩大后,前面出现过的物体容易发生漂移、形变甚至消失;当镜头重新回到原来的位置时,场景也可能变成另一种布局。

HiDream-O1-World 通过 "3D 先验注入 Memory 上下文 " 与 "Test-Time Training(TTT,测试时训练)" 两项机制,维持长时程空间一致性。

在生成过程中,模型会将场景几何结构、物体位置及空间关系等 3D 先验信息编码,并存储于 Memory 中。即使经过多轮镜头转动和位置移动,模型仍可以调用此前存储的空间信息,减少场景重置及物体位置变化。

Test-Time Training 则用来动态维护 3D 一致性,在推理阶段,模型针对当前交互序列进行轻量级的在线自适应优化,使模型内部表征与当前场景的 3D 几何约束在推理过程中持续对齐。

在物理一致性方面,智象未来从训练数据和推理机制两端入手。训练阶段,团队利用生成式世界模拟器构建合成视频,覆盖刚体碰撞、流体运动、柔性形变、重力抛射及光影变化等容易出错的物理场景,并通过时序因果建模强化跨帧依赖。

推理阶段,TTT 机制还可以针对当前场景中的材料和物体进行在线适应。例如,当画面出现水流、刚体或此前较少见的物体类型时,模型会动态调整内部表征,使后续生成结果尽量符合对应材料的运动特征。

智象未来称,在 WBench 的视觉合理性评测中,HiDream-O1-World 相比参测模型平均水平提升 13.6%;在考察流体、碰撞和形变等物理关系的因果保真度评测中,提升幅度为 12.7%。

值得注意的是,该技术路线已得到国际顶会认可。智象未来与复旦大学围绕空间一致性开展的研究论文《DreamWorld:面向 3D 一致世界建模的几何驱动视频扩散》(DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling)已入选 2026 年欧洲计算机视觉国际会议(ECCV 2026)。

四、瞄准互动影游、具身智能仿真和 3D 场景生产

在应用层面,HiDream-O1-World 主要瞄准 AI 互动影游、具身智能仿真和 3D 场景生产三类场景。

在 AI 互动影游中,模型可根据用户的移动、操作和选择实时生成后续场景,使剧情不再局限于预先制作的固定路线。用户可以直接参与叙事,并在同一世界中探索不同剧情分支。

在具身智能领域,模型可生成城市、工厂和室内等仿真环境,用于机器人、自动驾驶及智能制造系统的虚拟训练和测试。相比实景测试,仿真环境更容易批量构建低频、危险或高成本场景。

面向创作者和设计师,模型可用于生成手办、家居及艺术空间等 3D 场景,并支持结构调整、风格切换和内容补全。智象未来还计划进一步探索微观世界模拟,将其用于细胞行为、蛋白质相互作用等生命过程研究。

结语:世界模型竞争走向长时交互

HiDream-O1-World 能够在连续交互中维持空间结构、物体状态和物理逻辑。其在 WBench 导航分榜和物理维度取得第一,也说明世界模型的竞争正在从画质和生成时长,进一步转向空间记忆、交互控制与物理一致性。

从互动影游到具身智能仿真,这些应用都要求模型生成的世界能够持续存在,并响应操作。HiDream-O1-World 展示了原生全模态架构在这一方向上的进展,但距离大规模产业应用,交互速度、生成成本、长时间稳定性和仿真精度仍是需要继续验证的指标。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

复旦大学 物理 智东西 规律
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论