appso 21小时前
Seedance 2.5 还能这么玩?只要一张图, 生成一个可随意摆弄的 3D 世界
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

AI 刚学会捏手办,现在连一整间房都要承包了。

还记得连英伟达都在用的 3D 模型产品 Hyper3D 吗?今天,他们发布了世界生成模型 WorldGen。

不管你是胡乱拍的凌乱办公桌、路边随手抓拍的中式古建筑,还是从   AI   视频里抠出的一帧画面,只要往它面前一扔,WorldGen 就会像个强迫症晚期的空间物理学家一样,把一张平平无奇的二维照片,变成一个由独立 3D 资产组成的完整物理世界。

它不仅能一眼认出谁挨着谁、谁支撑着谁,还能顺手把悬空、错位、穿模的 Bug 全修好。

最爽的是,场景里的每个物件你都能单独拎出来、随手搬走,甚至直接丢进 Blender 或 Unreal 引擎里。

有意思的是,在世界模型爆火的 2026 年,贴上这个标签明明能跟投资画更大的「饼」。Hyper3D 还硬是不把自己叫做世界模型。

在 APPSO 和影眸科技团队的交流中,他们提到目前世界模型的定义没有统一标准,在他们的理解中,在真正理解并操纵整个世界之前,他们更愿意把自己称为「世界生成模型 」。

从一张 RGB 图像,到一整个可用的 3D 世界

Hyper3D 是影眸科技面向产业级 3D 资产生成打造的产品线,核心引擎是 Rodin 系列大模型。

通过一句话或一张图片,每个人都可以在几分钟内生成高质量、可编辑、可继续投入生产的 3D 资产。

将 Hyper3D 背后的 3D 大模型命名为「Rodin」,是为了致敬雕塑大师奥古斯特 · 罗丹。

Rodin 的迭代节奏很快,从早期的 Gen-1,到具备四边面输出与 PBR 材质的 Gen-1.5,再到把「先思考再生成」的类语言模型范式引入 3D 领域的 Gen-2.5,几乎每半年就会重写一次外界对 3D 生成能力上限的认知。

在此之上延伸出的 WorldGen,则把关注点从单体资产扩展到了整个场景,试图回答一个更棘手的问题,如何让 AI 生成的 3D 世界,真正具备被使用的资格。

去年,影眸科技联合团队在 SIGGRAPH 2025 上发表了 《CAST:基于单张 RGB 图像的组件对齐式 3D 场景重建》。SIGGRAPH 是计算机图形学领域公认的最高会议,最佳论文的评选历来极其严苛。在同期获得这一荣誉的商业公司中,只出现了三个名字,谷歌、Meta 和影眸 Hyper3D。

如何输入一张普通的 RGB 图像,而得到一整个由独立组件构成、彼此关系合理的 3D 场景呢?

CAST 先从图像中提取出物体级的 2D 分割与相对深度信息,再借助大模型对物体之间的空间关系进行推理,理解谁支撑着谁,谁挨着谁,谁被谁遮挡。

得到关系图之后,模型逐个生成组件级 3D 资产,并把它们对齐回原始图像的构图。

CAST 会显式地推断物体之间的接触与支撑关系,构建一张细粒度的关系图,再基于这张图对姿态进行优化,把穿透、悬空、错位等不合理现象一并修正。生成结果不仅在视觉上贴合输入图像,在几何上也遵循真实世界的物理约束,这为后续的仿真、交互与二次编辑打下了地基。

这项工作在学术层面的评价可以从后续论文的引用中看到端倪。CVPR 2026 的 WorldGen 论文,arXiv 上多篇涉及场景级生成的综述,都把 CAST 列为组件对齐式场景重建这一路径的代表方法,认为它在把物理约束嵌入生成过程这件事上,为后来者提供了一个可参照的范式。

值得一提的是,CAST 并不是一个停留在论文里的原型。它所验证的组件对齐、关系推理与物理校正,直接构成了 Hyper3D WorldGen 走向产品化的技术底座。

这在 3D 生成这个仍以研究驱动为主的赛道上并不常见。

与 Seedance 2.5 并肩做大片

WorldGen 面对的下一个问题就是「这些场景能被谁用,怎么用」。

一个用法是把 WorldGen 嵌入到多模型协作的  AI  工作流里。

视频生成模型 Seedance 2.5 已经能够输出高质量的动态镜头,画面表现足以支撑短片与广告级别的需求,不过还需要更高的可控性与三维一致性。

当 Seedance 2.5 生成的关键帧或参考图被喂给 WorldGen,后者可以把二维画面还原为一个具备组件结构、遵循物理约束的 3D 场景,再由 3D 场景反向驱动新的视频渲染、镜头调度或交互设计。

国内外的头部特效团队近两年都在尝试用 AI 前置资产环节,把概念设计、场景搭建、道具建模的周期压缩到原本的几分之一。WorldGen 输出的组件级资产带有清晰的拓扑与 PBR 材质,可以直接进入 Blender、Maya、Unreal、Unity 等主流 DCC 与引擎。

在具身智能的仿真训练上,机器人学习需要海量的、多样化的、物理上可信的三维环境,人工搭建成本极高,程序化生成又难以覆盖真实世界的复杂度。

WorldGen 能从任意一张现实场景照片出发,快速构建出结构合理、可交互、可渲染的仿真空间,为策略训练、感知模型迭代提供源源不断的场景供给。

此外,开放世界与 UGC 类游戏对场景资产的需求几乎没有上限,独立团队与中型工作室长期被建模成本卡住。

WorldGen 让一名美术在一天之内产出过去需要一个小组一周才能完成的场景原型,让关卡设计师可以在灵感闪现的当下直接把草图落地为可跑动的空间。资产的规模化生成正在把游戏开发的组织形态往更小、更快、更实验性的方向重新推动。

在空间计算领域,Vision Pro、Quest 系列以及国内的多款 XR 设备把三维内容的消费入口拉到了普通用户面前,内容供给的短缺立刻成为整个行业的共同痛点。

WorldGen 能够把现实空间的照片转成可漫游的 3D 场景,为空间视频、虚拟展厅、沉浸式教学等应用提供最基础的原料。

生成即消费,拍摄即建模,这正在被 WorldGen 一点点变成现实。

生成世界,然后呢?

今天的「世界模型」已经汇聚了众多门派。

Google Genie 3 像一名近景魔术师,根据玩家动作不断生成下一帧画面。WorldGen 则更像布景师,先交付一套可以保存、拆分和继续加工的 3D 场景;真正让物体碰撞、滚动和掉落的,仍是下游物理引擎。

世界模型们都在「造世界」,造出来的却不是同一种东西。

WorldGen 最值得关注的地方,其实不在于多了一款图片转 3D 工具,它试图把一次性画面,变成可检查、可修改、可复用的空间源文件。

都是 AI 生成,图像和视频主要交付「看见什么」,结构化 3D 还要回答「什么东西在哪里、彼此如何关联、接下来能做什么」。

现在,我们一次性获得的,不再是一个孤立的椅子或一辆孤立的车,而变成了一整间带有合理布局、物理关系正确、材质与光照可继续调整的房间。

当一个场景可以被拆解、验证和复用,它才开始从内容变成基础设施。

企业的 3D 资产才开始从纯粹的成本项变成具备资产项的属性。而个人与小团队才能够拥有与大厂在场景级内容上正面竞争的可能性。

生成降低的是从零搭建的成本,但验证的成本可能更高。AI 可以提出一个世界,人类仍要证明它能够运行。

毕竟,真正的世界模型不能只会做梦,AI 能看得见杯子,还要知道它有多重,把桌上的杯子推下去会摔成什么样。

相关参考️:

https://mp.weixin.qq.com/s/CuyaBAabswap-PZUcKxoew?scene=1&click_id=53

https://mp.weixin.qq.com/s/VH5M8opoXRDw_NKhiPAKbQ

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名 + 岗位名称」(请随简历附上项目 / 作品或相关链接)

更多岗位信息请点击这里

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 英伟达 物理 物理学家
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论