牛大发了!3D 生成,刚刚从「造物」一脚跨进了「造世界」!
看过《盗梦空间》吗?造梦师只用挥挥双手,物理规律下街道能折叠,建筑随之升起。
现在,类似的一幕就出现在 3D 生成中:
随便上传一张场景图,2~3 分钟后,一个完整的 3D 场景直接生成。
桌上的碗是可以单独拎起来的,椅子是可以旋转挪动的,不喜欢的家具也是可以随时随地替换的……
不同于只能围观的三维画面,这里每个资产都「活着」。
再或者,除了牛来,我们还可以马来、虎来!
踏出这一步的,正是 3D 生成头部玩家影眸 Hyper3D,其正式发布世界生成模型WorldGen,把 3D 生成从单个资产推向完整场景。
相比业内宽泛的 " 世界模型 " 概念,WorldGen 的定位更具体明晰——
不是生成一个只能观看的世界,而是交付可交互、可编辑、可进入真实生产环境的 3D 场景。
就像拼乐高积木,既能往里面持续加模块,也能随时抽出、替换其中任意一块;每一块还自带物理属性,如果不小心抽走关键支撑物,周围的物体同样会发生位移或跌落。
简单来说,这里的每一项资产都不会和背景彻底锁死,资产之间同样物理关系明确。
也正因为具体,它离真实工作也更近。
游戏需要关卡,影视需要片场,机器人需要训练环境……但它们现在都可以从 WorldGen 开始,其生成能力已经足以跑进真实生产场景。
这条路也不是凭空造出来的,早在去年,影眸 Hyper3D 就凭借自研的场景级生成技术CAST拿下国际图形学顶会SIGGRAPH 2025 最佳论文。
同期获奖的商业公司只有谷歌和 Meta。
而 CAST,就是 WorldGen 的技术基座。
所以如果说 AI 3D 的第一步是回答物体长什么样,那么 WorldGen 回答的则是第二个问题:
多个物体如何带着空间关系和物理属性,组成一个场景。
一张图→一组资产→一个场景
且说当下绝大多数的整体式场景生成,都有个通病:
好看,但中看不中用。
用户在场景内能做到的相当有限,基本就是走走看看。想改动?不好意思,只能推翻重来。
问题的根源出在生成方式上。用影眸 Hyper3D 创始人兼 CEO吴迪的话来说:
传统做法直接将整个场景作为一个模型生成,所有内容容易被合并成不可拆解的整体,场景很难继续使用。
WorldGen 的关键变化,是把场景拆解为可单独操作的资产,同时保留它们之间的空间与物理关系。
整个生成流程拆开来看是这样的:
打开官网(https://hyper3d.ai),选择 WorldGen 生成。
这里咱们上传一张卡通风格的厨房局部图。
系统会自动识别出图中的主要物体,也可以手动框选,单独指定要生成的部分。
接下来,每件前景物体将作为独立资产逐个生成,大约2 到 3 秒就能出预览。
背景环境则用3D Gaussian Splatting补全,兼顾视觉完整性。整体可压缩至 2 到 3 分钟。
打开SimReady 模式后,系统还会为每件资产补充碰撞体,并估计质量、摩擦系数、恢复系数等仿真所需的物理属性。
最终成功复刻3D 版胡闹厨房。
场景初稿到手后,行业应用也不在话下。
先看数据需求最迫切的具身智能。
真实采集不仅要承担场地、设备和人员成本,火灾、坍塌等危险环境也无法被安全复现;传统仿真虽然可以补位,却又需要工程师耗费大量时间手把手搭场景,成本高还偏差大。
WorldGen 则在二者当中达成了微妙的平衡。
以影眸 Hyper3D、地瓜机器人、谋先飞在今年 7 月联合发布的闭环方案为例:
WorldGen负责从真实影像中生成可交互的三维场景,场景内的 3D 物品全部都具备仿真导入能力。
谋先飞的 MotrixSim 引擎负责物理与并行仿真,让机器人在其中运动、抓取和交互。
地瓜机器人提供算力和开发工具链。
三方整合,才形成从场景准备、仿真运行到数据采集和策略验证的完整链路。
作为NVIDIA Inception(初创加速计划)的一员,影眸 Hyper3D 也正通过 WorldGen 实现英伟达全球仿真生态的进一步联结,将 " 单个资产用于 Isaac Sim" 拓展为" 整个场景用于 Isaac Sim"。
游戏圈用法更直接。
过去拿到一张关卡概念图,美术和策划接下来还有一长串工作。
图生 3D 已经能缩短单件资产的制作时间,但这些资产最后仍要靠人一件件组装。
WorldGen 试图把这部分工作进一步前置。
它先从概念图生成一版对象化场景,策划可以检查动线和空间,关卡设计师可以移动或替换道具,美术再决定哪些关键资产值得精修。
更方便的是,WorldGen 生成后的独立资产能够直接进入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等 DCC 与实时引擎环境,进行材质调整、动画绑定、关卡编辑、性能优化等二次创作。
今年 7 月,影眸 Hyper3D 已经与Unity 中国达成合作,合力构建打通从 3D 生成到实时游戏应用的工程闭环。
据团队介绍,WorldGen 灰度测试期间,也已有多名游戏从业者对其表达了兴趣。
影视行业则看中了它当「导演台」的潜力。
吴迪举过一个很具体的例子:
导演要把画面左侧盘子里的苹果移到右侧盘子,纯视频生成很难稳定控制;
用 WorldGen 建立可控 3D 基底,再用视频生成模型提升最终画面质量,这样则相当直接。
目前已经有创作者把WorldGen与Seedance 2.5结合:
WorldGen 提供 3D 场景,可以轻松完成镜头调度和构图调整,再交给视频生成模型,补齐人物表演、材质光影和最终风格。
WorldGen 的AI Render 模块则具备了 AI 渲染、自由运镜等功能,同一场景可以变换多种视觉风格,也为产品概念演示、空间导览等内容带来制作效率与品质的双重提升。
这套新用法,将让影视生成不必再在可控和好看之间二选一,出手即是大片级。
据了解,WorldGen 如今已经进入实际影视项目的制作流程,相关作品将在完成后陆续上线。
XR 与空间计算则验证了它的通用性。
既然场景可以从任意视角观察,主要对象又能被替换和移动,一张普通照片便有机会变成可以进入、浏览和调整的沉浸式空间。
室内设计、沉浸式教育、空间展示,都可以成为它的潜在落点。
搭配 Apple Vision Pro 等 XR 设备,《头号玩家》照进现实。
当然,这些还只是 WorldGen 的一小部分用法,潜力无穷,等你来探索~
从顶会最佳论文到产品化,WorldGen 攒了整整一年
要理解 WorldGen 是如何一步 " 登天 " 的,还得从去年那篇CAST论文说起。
场景生成难在哪里?
不是把图生 3D 连续运行十几次就能实现的。单张图片天生缺少深度、真实尺度和物体背面的信息,还存在遮挡和透视畸变。
比如一个苹果被盘子挡住,模型要先补全看不见的部分;稍微生成大一点,摆回桌面时就可能穿进盘子;位置再偏一点,后续碰撞体和支撑关系也会跟着出错。
场景错误还会级联,一步错步步错,最后摊在产品里就是用户返工实打实的成本。
CAST 的思路可以压缩成四步,先看懂→再补全→然后放回去→最后做物理纠错:
Step 1:模型把输入图片拆成对象,并估计相对深度,让一张没有结构的 RGB 图片变成对象清单和空间线索。
Step 2:针对每个物体独立生成完整 3D 几何。遮挡感知机制会参考可见部分和场景信息,补出图片里看不到的区域。
Step 3:把生成好的物体放回统一空间。系统需要估计旋转、平移和尺度,尽量保持与原图的构图和位置一致。
Step 4:建立更细的物体关系图,描述接触、支撑、悬挂等关系,再结合 SDF 进行物理校正,减少互相穿透、悬空和不合理堆叠。
于是这套框架拿到了 SIGGRAPH 去年的最佳论文,组委会的评价是:
CAST 支持开放词汇的重建任务,在处理遮挡、精确对齐物体以及确保物理世界与输入图像的一致性方面表现卓越,为虚拟内容的创作和具身智能相关领域开辟了新的可能性。
但距离产品化,CAST 还差一口气。
团队后来又花了将近一年的时间,来专门解决多模块串联导致的错误累计问题。
通过减少冗余模块、重构底层流程和提升单环节稳定性,才最终让 WorldGen 以完全体形态发布。
至于为什么说它是「世界生成模型」,而非广义的「世界模型」或者「场景生成模型」,影眸 Hyper3D 联创兼 CTO张启煊是这样定义的:
我们认为,世界生成模型是通过文本提示或一张图像,把其中描绘的场景还原为可用的三维世界。
它既能生成开放式场景,也更接近" 世界 "的表达。
它仍然是广义世界模型的重要组成部分,毕竟真正的 " 世界模型 " 需要某种载体来承载世界的外观与属性,只不过,影眸选择的载体是3D。
3D 生成,进入场景级时代
回到最初的问题:WorldGen 到底解决了什么?
答案已然在应用中清晰。
它不会直接生成一款可以上线的游戏、一部完整的电影,也不会替具身智能完成训练和决策,但它解决的是所有这些产业共同面对的前置难题:
怎样将脑洞与海量资产结合起来,快速场景化变现。
以Hyper3D Rodin Gen-2.5为代表的 3D 生成模型,已经将单资产制作周期从数天缩短至分钟乃至秒级,但真实项目中,极少只需要孤立资产。
后续不可避免要对不同形态、物理属性的资产进行拼装,包括识别、校准、导入引擎等,这些仍然都需要人来做。
WorldGen 改变的,正是 AI 3D 的基础交付单位:
从一件生成好的物体,变成一份已经初步搭建完成的场景。
虽然距离最终成品仍有进步空间,但对于游戏设计师、影视创作者和仿真工程师而言,已经提供了一个能够继续编辑的起点。
而场景要真正可用,仅仅 " 看起来像 " 还不够。
对物理规律的模拟,才决定了 WorldGen 的上限。创造出的细节越多,就越真实、越好用。
当生成出的场景能够承载内容、模拟交互,并接入现有工作流,它吸引的便不再只是尝鲜的普通用户,还有真正需要提高生产效率的专业创作者。
3D 生成原本就是最接近生产流程的 AI 应用之一。只有当生成结果能够被持续编辑、复用并投入生产,它的价值才会真正释放。
过去限制 3D 生成落地的,就是 WorldGen 今天补位的场景级缺口。
它的出现,可谓天时地利人和。
于是从生成物体到组装世界,3D 生成,就此进入场景级时代。
官网链接:https://hyper3d.ai
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦