猎云网 15小时前
PrimalVerse元昊动力完成数亿元种子轮融资,清华团队打造4D世界模型基模
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

来源:猎云网

近日,4D 世界模型公司 PrimalVerse 宣布完成数亿元种子轮融资,由联想之星、银杏谷资本、啟赋资本、卓源亚洲等知名财务投资机构联合参与,手术机器人领域头部产业方精锋医疗战略投资。据悉,本轮融资将主要用于 4D 世界模型基模研发及团队扩充,并持续推进其在具身智能、游戏影视、自动驾驶、医疗手术等垂直场景中的应用验证。

PrimalVerse 由一支清华背景的顶尖世界模型团队创立。团队长期深耕 3D/4D 重建、神经渲染、物理仿真与机器人,是全球少数能够贯通 4D 世界模型完整技术链条的团队。

定义第五代基模:从生成内容,走向推演世界

大语言模型让 AI 学会了预测下一个词,视频模型让 AI 开始预测下一帧画面。但随着 AI 深入机器人、自动驾驶等真实物理世界的场景,模型需要进一步回答:

一次行动之后,世界将发生什么?

回看基础模型的发展,第一代以 GPT 等语言大模型为代表,主要解决语言理解、推理与对话(文本 Token);第二代融合了图像 Token 和文本 Token,以 Nano Banana、GPT Image2.0 为代表,实现图文理解与图像生成;第三代以 Sora、Seedance 等为代表,引入了视频 Token,开始处理时间动态与动作连续性。前三代模型主要建模语言与二维视觉内容,尚未真正进入三维物理世界。而第四代带有 3D token 的原生多模态大模型将开始表示几何结构和物理属性;下一阶段,基础模型需要进一步把空间、时间、物理规律与动作交互纳入统一表征。

基于这一判断,PrimalVerse 团队提出:第五代多模态大模型,将是以原生 4D World Token 为核心的世界模型基模(4D=3D 空间 + 时间)。

4D World Token 可以理解为模型理解物理世界的 " 新语言 ":它不只记录某一帧画面,还需要持续表示场景中的物体是什么、位于哪里、如何运动、具备何种物理属性,以及在动作作用下将如何变化。

当语言、图像、视频、3D/4D 世界状态能够在同一模型中联合训练,AI 学习的将不再只是世界的视觉表象,而是世界本身的结构、规律与动作后果。模型也将从 " 生成一段视频 ",进一步走向 " 运行和推演一个世界 "。

PrimalVerse 创始人表示:

"4D 不是世界模型的一项附加能力,而是物理世界本身的基本表达。世界模型的第一性问题,是能否准确刻画世界从一个状态走向下一个状态,而这需要同时理解空间、时间、物理属性与交互关系。我们相信,判断模型是否真正理解物理世界,最终应当与 4D 表征对齐;只有先构建出原生 4D 世界模型,才能为不同技术路径提供统一、可信的物理世界基准。"

PrimalVerse 希望直接从底层构建原生 4D 世界状态,在统一模型中同时学习空间、时间、物理与交互,并将几何、材质、运动、接触和物理属性纳入状态变化过程,定义真正面向物理 AI 的 4D 世界模型范式。

全球稀缺的 4D 世界模型全栈团队

构建原生 4D 世界模型基模,需要贯通重建、仿真、渲染与机器人四大能力栈,任何一项能力的缺失,都会限制世界的完整构建、持续演化与真实交互。全球范围内,能够覆盖并打通完整技术链条的团队极为稀缺。

PrimalVerse 核心团队来自清华、北大、上海交大、港科等顶尖高校,长期深耕 4D 世界模型关键技术,已经在 4D 世界模型的各个核心环节形成国际领先成果:

在实时神经渲染方向,SlimmeRF 获得 3DV 2024 Best Paper;在可控仿真方向,MARS 获得 CICAI 2023 Best Paper Runner-up,这也是全球首个开源高拟真自动驾驶仿真器,开创模块化神经渲染自动驾驶仿真范式;在机器人领域,Dexora(ICRA 2026 Best Paper Finalist)是全球首个开源高自由度双灵巧手 VLA 模型;Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots(RSS 2026 Best Paper Finalist)

实现从单张人像自动生成可制造、无碰撞的机器人面部机械结构,将专业设计时间从 22.8 小时缩短至 11.7 分钟;在重建与表征方向,TRELLIS.2 获得 CVPR 2026 Best Student Paper,是全球首个单图生成 8K 3D 模型,首次实现几何与材质的原生 3D 生成,突破了行业普遍依赖 2D Diffusion 生成材质的路径。

这些成果共同构成了一条清晰的路径:

理解世界、构建世界、推演世界,最终驱动智能体在世界中行动。

PrimalVerse 团队已产出几十篇 CVPR、ICCV、SIGGRAPH、3DV、RSS、ICRA、ECCV 等顶级会议成果,并在重建、仿真、渲染、机器人四大底层技术栈拥有 Best Paper 级成果。 PrimalVerse 的成立,是团队将多年分布在不同前沿方向的积累,第一次汇聚为一个统一目标——打造第五代多模态 4D 世界模型基模。

从垂直世界模型切入,验证通用基模能力

第五代 4D 世界模型的价值,将首先在对动态空间、物理真实性和动作交互要求最高的场景中释放。

在具身智能领域,PrimalVerse 已与多家细分领域头部企业开展合作,围绕仿真数据生成、动作后果预测、策略训练与 Sim2Real 推进联合验证。其中,PrimalVerse 与极智嘉联合研发了面向真实仓储作业场景的世界模型 Gravity 4D,并已在多 SKU 抓取、料箱搬运及移动机器人协同等端到端作业中完成验证。团队在 Dexora、TA-VLA 等成果中积累的动力学预测、力反馈建模与高自由度操作能力,也不断转化为面向真实机器人任务的世界模型解决方案。

在医疗手术领域,战略投资方精锋医疗与 PrimalVerse 正围绕医疗场景专用世界模型、具身智能手术机器人及智能仿真训练平台等方向开展深度联合研发,将世界模型能力与手术机器人本体、临床场景、远程手术系统及医生培训体系深度融合,推动手术机器人由精准执行工具升级为具备场景理解、风险预判与协同操作能力的智能外科基础设施。

在游戏影视领域,PrimalVerse 与头部影视公司达成深度战略合作,同步推进虚拟影棚及导演项目的合作意向。基于 Light-X 等成果,公司将工业级 3D 资产生成、可控运镜与可控打光能力导入实际制作流程,服务动态内容生产、虚拟拍摄与可编辑场景构建。

在自动驾驶领域,PrimalVerse 具备从高拟真仿真、世界状态预测到城市级三维重建的完整能力栈:MARS 支持复杂道路场景的可控仿真(首个开源高拟真可控自驾仿真器,奠定自驾神经渲染仿真基石,被多个大厂采用),OmniNWM 实现多模态、长时序世界预测与策略评估;团队与长城汽车联合研发的 TideGS,则突破大规模 3DGS 训练的显存瓶颈,单张 24GB GPU 上支持超过 10 亿个 Gaussian Primitives,较行业单卡训练规模提升约一个数量级(对比 World Labs Spark 2.0 ,约 1 亿),为城市级原生 3D 世界构建提供底层支撑。

具身智能、医疗手术、游戏影视与自动驾驶并非四条完全独立的业务线,而是一套 4D 世界模型能力在不同场景中的验证:自动驾驶提供复杂动态世界,具身智能提供动作与物理反馈,游戏影视验证高质量世界生成与实时渲染,医疗手术则检验模型在高安全要求、复杂形变与精细交互场景中的理解和推演能力。多场景成果与产业合作,也将持续沉淀数据、模型和系统能力,反哺通用 4D 基模。

未来,PrimalVerse 将从垂直场景中的训练、仿真和内容生产需求切入,逐步构建跨场景、跨行业迁移的通用 4D 世界模型,成为物理 AI 理解、训练和推演世界的基础模型入口。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 自动驾驶 物理 融资 清华
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论