最近,李飞飞和她的 World Labs 交出一张新牌:Atlas。
这是一个从零预训练的世界模型,以单一架构打通世界生成、空间重建与时空模拟,并原生处理文本、图像、视频和 3D 数据。单张照片可以生成一分钟 1440p 视频,三五台普通手机就能实现 " 子弹时间 ",手机拍摄的普通房间也能变成机器人的仿真训练场,Atlas 将 " 世界模型 " 的边界又往前推了一步。其背后,是 World Labs 累计超过 12 亿美元的融资,以及约 50 亿美元的估值。
热度之下,创投圈抛出一个熟悉的问题:中国有没有对标者?
不过或许应该换一种问法。真正值得追问的不是 " 谁在模仿 Atlas",毕竟 Atlas 发布至今不过数日,追随者无从谈起。而是 Atlas 出现之前,全球还有谁独立走在同一条技术路线上?
沿着这个线索梳理国内空间智能与具身智能赛道后,一家公司浮出水面:杭州影身智能。答案多少有些意外。过去,影身智能很少依靠演示视频或炫技发布会进入公众视野,外界对其印象甚至停留在一家 " 柔性垂类具身智能公司 "。拆解其技术底座原生 4D 世界模型 " 破界 S1",会发现其与 Atlas 的技术同构程度,远超想象。

从李飞飞的 Atlas 说起
先来看清 Atlas 到底是什么。抛开演示效果,Atlas 的技术路线由三个关键决策构成:
第 一,生成与重建的统一。传统 AI 通常把 " 生成图像 " 和 " 重建 3D" 拆解为两个任务、两套模型。Atlas 用 " 空间上下文 "(Spatial Context)把两者统一到同一套自回归推理框架中:每张图像都被锚定在三维空间的具体位置、携带显式相机位姿,模型以此生成下一个空间元素,输出可以是新视角图像、深度图和点云。输入图像少,模型就用世界知识 " 脑补 " 不可见区域;输入图像多,输出就收敛为忠实重建。生成与重建,只是同一模型在不同输入密度下的两种表现。
第二,普通摄像头的稀疏视角重建。Atlas 不需要专业捕捉设备,3 到 5 台普通手机、24 帧视频,就能重建一个空间并生成任意新视角,包括 " 冻结时间 " 的子弹时间效果。在稀疏视角 3D 重建基准上,甚至超越了 VGGT 等专用开源重建模型。
第三,Real-to-Sim 的机器人闭环。具体来说,只需用普通视频扫描真实场景,模型就能重建为仿真环境。当模拟机器人在其中运动时,由同一个模型生成其传感器所看到的 RGB 图像和深度数据," 世界 " 和 " 机器人眼中的世界 " 出自同源。
一言以蔽之:抛弃 2D 像素拟合,让空间和时间成为模型的原生维度,用一个模型同时回答 " 世界长什么样 " 和 " 世界将如何演化 "。
一条独立收敛的中国路线
再来看影身智能。
这家公司于 2024 年 6 月成立于杭州,创始人闵伟曾任阿里巴巴机器人团队负责人;首席科学家刘烨斌教授是清华大学长聘教授、国家杰青,其团队深耕动态三维重建领域二十余年。
创业之初,团队就做出一个与主流具身智能路线并不相同的判断:大语言模型处理的是一维语言,视频生成模型处理的是二维图像序列,而机器人面对的是三维空间叠加一维时间构成的真实 4D 物理世界。在他们看来,用一维和二维的数据,训练不出理解 4D 物理世界的智能," 这是跨不过维度的鸿沟 "。
以此为标尺,影身智能与当前两条主流路线拉开了距离:
VLA(视觉语言动作模型)建立在大语言模型之上,擅长理解语义和任务指令,但方位坐标、空间关系和物理约束不是语言天然承载的信息。真实世界的一切都被文字 " 降维处理 " 过,在真实物理系统中不具备直觉。
WAM(世界动作模型)的基座是视频生成模型,虽然引入了对未来的预测,却继承了视频生成的全部问题——幻觉、维度限制,只要 " 符合剧情 " 即可,不必严格遵循物理规律,这对在真实世界干活的机器人是巨大风险。
影身的答案干脆利落:从数据出发,用原生 4D 数据训练原生 4D 模型,构建一个与大语言模型、视频生成模型并列的新基座。

" 原生 " 二字是这条路线的题眼,包含两层含义:数据是原生的,直接采自真实物理世界,不是仿真和人工标注;模型是原生的,专为 4D 数据从零设计,而非把低维信息 " 塞进 " 现成模型。在影身看来,低维数据混入 4D 训练是一种污染,正如早期非原生多模态模型常画出六根手指,而原生多模态模型能正确画出五指。语言本身有幻觉,若不在源头解决,后续问题难以排查。这与 Atlas" 从零预训练、让空间和时间成为模型原生维度 " 的底层信念完全同构。
逐条对照下来,同构性贯穿了整个技术栈:
生成与重建的统一——对应 " 破界 S1" 的 " 三能一体 " 与 "Real-to-Real" 管线。影身的 4D 基座世界模型 " 破界 S1" 将渲染、仿真、规划集于一体,重建与生成在同一基座内完成。数据生产管线本身就是一个模型:多视角 2D 视频输入,模型在内部生成时空对齐的 4D 格式数据。真实多视角视频转化为真实 4D 数据,影身称之为 "Real-to-Real"。更具象的证据是深度生成方式:不依赖深度相机实测,而是用算法从 RGB 生成深度。" 一个平面就是一个平面 ",点云一致性甚至优于传感器实测。这与 Atlas" 输入越少、想象越多 " 的生成式重建哲学如出一辙。
普通摄像头阵列的实时 4D 重建——对应 " 影身 360",成本更低。Atlas 用 3 到 5 台手机做离线重建;影身的 " 影身 360" 数采系统用 4 到 6 个阵列 RGB 摄像头环绕工位,以家用级摄像头加单张消费级 GPU,实现对工人作业过程 25FPS 的实时高精度 4D 时空数据合成,全程无接触、无感采集,不干扰被采集对象。
要知道,过去业内高质量 4D 采集需要在布满 80 个摄像头的 " 笼子 " 里进行,整套设备价值数百万、租一天两万元,全球实验室攒下的 UMI 数据不过 1500 小时量级,4D 数据曾是名副其实的 " 奢侈品 "。影身在两年内把摄像头从 80 个降到十几个、再降到 4 到 6 个,把采集从几小时压缩到实时生成,第 一次让大规模工业化采集成为可能。其数据架构呈金字塔形:顶层是历史积累的高精度稠密视点数据,以此训练模型适配稀疏视点采集,再由模型同步生成海量 4D 数据训练下一级模型。
终局是单摄像头也能生成 4D 数据,届时互联网上数十亿小时的存量单视角视频都将被 "4D 化 ",数据来源问题从根本上被解决。一个是将普通摄像头变成 " 子弹时间 " 摄影棚,一个是把普通摄像头变成产线数据工厂。犹如同一枚硬币的两面,只是影身把这一面铺进了车间。
Real-to-Sim ——对应 "V-4D-A" 架构,并且多走一步。Atlas 的机器人故事到 " 生成仿真训练数据 " 为止;影身的 V-4D-A(视觉 -4D- 动作)架构则从真实产线 4D 数据出发,由基座模型直接输出驱动物理机器人的动作序列,形成 Real-to-Real 闭环。
支撑其跨过 " 最后一公里 " 的是两个设计:其一,模型预测的是 4D 点云。物体在未来如何运动,与操作者是人手、灵巧手还是机械夹爪无关,运动规律可以逆向推导适配任意本体的关节参数,天然具备跨本体能力,而传统真机采集记录的关节角度换一台机器人就作废。其二,自进化学习。不只学正确样本,还主动把错误样本纳入训练,世界模型预测下一时刻的变化,一旦实际变化与预测不符,系统就会更新知识,产线数据持续回流反哺模型。世界模型到机器人执行之间的最后一公里,Atlas 还停在演示里,影身已跑在产线上。
两家没有任何交集的公司,在太平洋两岸独立推导出了同一个答案。这种技术路线的平行收敛,在科技史上往往意味着一件事:这条路是对的。
影身多走的那几步:时间、订单与数据飞轮
如果说同构性证明了 " 中国版 Atlas" 的成色,那么拉开两者差距的,是影身手里三个 Atlas 暂时没有的筹码。
一是时间。早在 2024 年,影身智能就押注原生 4D 路线,2025 年在制鞋产线跑通试点并拿下国内具身智能领域首 个千万级柔性智造订单,2026 年 4 月公开原生 3D/4D 动态世界模型,同年 8 月携 " 破界 S1" 亮相世界机器人大会。每一个节点都早于 Atlas 的发布,与其说是 " 中国追随者 ",更像是 " 先行版 "。
二是落地。Atlas 目前尚未对外开放,也没有公开 API 和定价,机器人能力仍缺少第三方验证。影身已经把世界模型带进真实产线。
涂胶机器人 ShadowGlue、压底机器人 ShadowPress 已投入生产,在手柔性智造订单总额达数亿元。公司披露,制鞋涂胶效率和良率早已超过人工,作业精度达毫米级,今年计划交付 250 台搭载 4D 世界模型 " 大脑 " 的具身机器人。
更具战略意味的是场景选择:制鞋是典型的 " 双柔性 " 场景(柔性生产 + 柔性物体操作),款式迭代快、产线无法长期固定,衣服线缆等软性物体的状态变化,传统编程难以穷举所有状态。这是全球机器人行业公认无人实现大规模落地的极端工况,也是上一轮工业革命没能攻克的 " 最后一公里 "。
一旦这套能力在制鞋场景跑通,边界就不再局限于鞋厂。箱包、家居、服装等柔性制造场景面对着相似的问题,底层能力具备复用空间。
值得一提的是,影身还能以 ODM 轻资产模式输出算法 " 大脑 " 和一体化解决方案。其 4D 世界模型天然支持跨本体,人形、单双臂、轮式、飞行式皆可适配,通过跨本体实现比 " 通用本体 " 更大范围的跨场景。
三是飞轮。影身已经跑通了一条完整链路:真实场景产出 4D 数据→训练基座模型→模型赋能产品→落地场景持续新增数据。世界模型的竞争,归根结底仍是数据,尤其是原生 4D 数据,只能从真实物理场景中一帧一帧持续采集。对影身来说,每多交付一个工位,其数据壁垒就加厚一分。公司披露,其 3D/4D 数据的训练效率是传统视频训练方法的 20 倍。按照规划,公司将于 2026 年底至 2027 年上半年发布大规模 4D 数据集与具身智能大模型。若能如期开放,这将是全球第 一个工业场景的原生 4D 开源级数据资产。
这种能力也开始越出工厂。
影身正将同一 4D 基座延伸向数字文娱,已完成 4D 演唱会的基础技术攻关:多视角视频经模型转为 4D 格式,压缩成标准视频流后,普通浏览器即可播放。公司还正在筹备全球首场 4D 直播演唱会,更远处的目标是将自由视角能力带到电影、体育赛事等内容形态中。
这条路线与 Atlas 形成了一个有意思的对照:Atlas 最吸睛的演示之一是相机可控的空间生成。影身则试图将类似的自由视角能力,同时放进 B 端工业和 C 端内容场景。
估值坐标
把 World Labs 与影身智能放在一起,最值得看的其实不是技术演示,而是两家公司所处的商业阶段。
World Labs 以超过 12 亿美元融资、约 50 亿美元估值,目前 Atlas 仍处于研究阶段。影身智能累计融资仅近亿元,在同一条技术路线上做到先行发布、量产验证、订单闭环。
资本市场常说 " 先相信,再看见 "。Atlas 让全世界看见了空间智能世界模型的价值;而影身智能的故事是 " 先看见,再相信 ",在车间里把蓝图变成了良品率、订单和数据飞轮。
正如李飞飞所说,空间智能是 AI 的下一个前沿。更值得注意的是:在 Atlas 出现前,中国已经有人沿着相似的方向往前走。影身智能没有等到这条路线被全球看见,便已开始训练原生 4D 模型,并率先把它带进工业现场。
如果一定要寻找参照,影身与 Atlas 更接近两条平行推进的路线:一条向通用空间智能推进,一条先在真实物理世界里完成验证。Atlas 让市场看见了这条路能走多远;影身正在回答另一个问题:先在真实世界里跑通商业逻辑。
文章来源:投资界原创
原文地址:https://news.pedaily.cn/202609/568825.shtml
【本文为投资界原创,网页转载须在文首注明来源投资界(微信公众号 ID:PEdaily2012)及作者。微信转载请在原文评论区联系授权,违者必究。免责声明:本文不构成任何投资建议。市场有风险,投资需谨慎。】


