
9 月,人形机器人公司 Figure 称,其租下旧金山湾区 30 套陌生住宅,将搭载 Helix2.5 模型的 Figure 03 逐一放入其中,在未采集新数据、未做环境适配的前提下执行家务任务。Figure 公布的结果显示,其在整理客厅、叠毛巾、铺床三类任务中的零样本环境迁移成功率从 9% 升至 56%。
这一数字如果成立,回答了一个此前很少被正面回应的问题:机器人能否把已学会的行为迁移到从未见过的真实环境中?但更准确地说,它只提供了一个公司内部的初步证据,而不是行业定论;且该成功率限定于上述三类特定任务。
过去两年,具身智能行业最不缺的就是 Demo 视频,但 " 在实验室里把一件事做成过一次 " 和 " 换一个环境还能继续做 " 之间的鸿沟,正在取代模型参数和融资规模,成为衡量一颗机器人大脑是否成立的新标尺。

01 概念退潮,标准浮出
" 世界模型 " 正在成为具身智能领域最拥挤的标签。VLA、视频预测、行为预测、因果建模,不同技术路线的团队都在使用同一个词,但各自解决的工程问题截然不同。有人用它指代视频生成系统,有人用它描述动作后果预测器,有人用它包装仿真环境,还有人将它等同于因果推理引擎。
从离线训练工具到在线决策模块,同一个词涵盖的范围从像素级生成延伸到符号级推理,听者无法从标签本身判断一个团队究竟在解决什么问题。这种概念模糊的代价是判断失焦:资本难以有效定价,技术路线之间无法真正比较,有能力的团队反而容易被淹没在标签噪声里。
行业因此被迫回到一个更朴素的问题:一颗真正能驱动机器人的 " 大脑 ",到底该用什么标准衡量?标准正在从工程实践中逐步收敛。域变换联合创始人吴昊将其拆解为三道递进的门槛:能否预测未来?预测结果能否帮助决策?决策能否在真机上闭环?三者并非并列——预测不等于决策,决策不等于执行,任何一环断裂都意味着前功尽弃。
按照这一标尺重新审视行业,分野变得清晰。Physical Intelligence 发布的 0.7 模型,据其披露,引入了用于预测子目标图像的世界模型组件。在折叠衣物任务中,其成功率约为 80%;在厨房场景中,空气炸锅任务经提示词优化后成功率可达 95%,但初始成功率仅 5%。1XTechnologies 则称,其将世界模型集成进人形机器人 NEO 作为机器人策略,使机器人能够在执行动作之前预测动作后果,并基于互联网视频预训练来学习新技能。
这些进展的共同指向是:世界模型的价值,在于它是否让机器人真的更会干活。更严苛的检验来自长程任务。墨奇智能在 2026 世界机器人大会上的演示提供了一个参照:据公司介绍,搭载自研 MoRA 模型架构的轮式机器人 MORPHI KINO,在家庭场景中连续完成了清理桌面、冰箱补货、衣物洗烘及折叠的全套任务,全程十五分钟,无需人工干预。
但墨奇智能 CTO 黄青虬的判断是,即便每个模块的成功率做到 99%,几十个动作叠加之后整体失败率也会急剧上升。长程任务的可靠性,本质上是对系统级工程能力的检验,而非单一模型指标的比拼。这些案例共同指向一个判断:真机闭环正在成为新的行业标尺。在实验室里把一件事做成过一次,和换一张桌子、换一种材质、换一个本体之后还能继续做,是两件完全不同的事。
而当行业开始用真机闭环检验项目时,一个更深的矛盾也随之浮现:闭环中暴露的问题,往往不是模型不够大,而是语言智能与物理智能之间的鸿沟。

02 物理智能的边界何在
某代云端大模型接入真机测试后,一个尖锐的问题浮出水面:语言模型能否直接接管机器人的 " 大脑 "?支持者认为,大语言模型已经展现出强大的推理、记忆和规划能力,足以胜任机器人的高层决策;反对者则指出,语言与动作之间存在一条无法仅靠规模扩展跨越的鸿沟。
在真机表现上,最新一代云端大模型确实展现出过去 VLA 模型难以获得的能力:更强的指令泛化、上下文学习,以及将复杂目标拆解为若干步骤并逐步执行的长程理解能力。做完一步之后重新观察环境,再判断下一步,这种 " 边做边想 " 的能力,是过去专门为机器人训练的模型难以企及的。
但局限同样明显,且恰恰暴露在物理世界最基础的环节上。最直接的约束来自实时性:云端大模型可以慢慢推理,机器人在现实中却需要快速反应,不可能每执行一步都停下来长时间思考。另一个约束来自视觉反馈的不可替代性。有研究者在真机测试中观察到,当摄像头被部分遮挡,相当于把模型的 " 眼睛 " 蒙住,任务表现会明显下降。
云端大模型能够理解自己想做什么,却不意味着它拥有一个完整的 " 动作之后世界会如何变化 " 的物理模型。这指向一个更底层的技术事实:许多物理动作本身不以语言作为最直接的中介,正如一个人伸手拿起水杯,不需要先在脑子里用语言描述一遍 " 我要把手移动到杯子旁边,再抓住它 "。语言更适合理解、规划和长程任务拆解,而真正直接连接物理世界和机器人动作的,是视觉、触觉与力觉。
但当前触觉领域的公开数据规模远小于视觉数据。有产业人士称,触觉领域全球公开数据集数量尚不足视觉数据集的万分之一;但该说法为单一来源,且统计口径为数据集数量而非数据量,高质量触觉数据仍然是制约具身智能规模化落地的核心瓶颈之一。这一现实正在推动技术架构的分层:大语言模型承担更高层、更低频的规划角色,类似人类的 System 2;而 VLA 或世界动作模型承担更快、更贴近动作执行的部分,类似 System 1。
章鱼动力在 2026 世界机器人大会上发布的 " 脑—手—数据 " 技术体系,据其介绍,正是沿着这一思路展开的。其 SYNWorld 模型采用 MoT 架构,通过模态专属编解码器同时处理文本、视觉、动作、力觉、触觉及本体状态,配套的 OctoH-Hand 灵巧手负责高精度力控交互,OctoSense 数采方案则通过肌电跨个体零样本泛化来解决操作数据对齐真机的痛点。三者被设计为一个闭环,而非独立模块的拼接。
物理智能不能只靠语言。语言模型可以帮机器人理解任务、规划步骤,但真正让机器人 " 会干活 " 的,是视觉、触觉、力觉与动作之间的紧密耦合。而当模型架构逐步分层、能力边界逐渐清晰,一个更棘手的问题随之出现:即便模型在实验室里表现良好,换一个场景、换一个本体之后还能不能稳定运行?
03 先 Scaling 还是先进场景
模型架构的分层解决了一个问题,却暴露了另一个更深层的分歧:通往通用机器人大脑的路径,究竟应该先把模型做聪明,还是先把它送进真实世界?
Figure 的 Helix 2.5 提供了 " 规模优先 " 路线迄今较为完整的实验证据之一。9 月,Figure 称其将搭载 Helix 2.5 的 Figure03 放入旧金山湾区 30 户陌生家庭,执行整理客厅、叠毛巾、铺床三类任务,在未采集新数据、未微调模型的前提下,零样本环境迁移成功率从 9% 升至 56%。更关键的是其提出的 " 人类到人形机器人的迁移缩放定律 ":据 Figure 披露,预训练数据量每翻倍,下游动作预测损失呈可预测的下降趋势,团队甚至在训练前就能较准确预测同规模下的损失趋势。
但这里必须区分两件事:动作预测损失下降,不等于机器人更会干活;公司内部成功率提升,也不等于跨本体、跨场景的通用能力已经成立。Figure 的结论是,预训练数据的规模和质量,可能比在具体场景中反复采集数据更高效。国内路线中,极佳视界是同一逻辑的样本。据公开榜单,其 GigaBrain-0.1 曾在 RoboChallenge 中以 51.67% 的任务成功率位列第一,但该纪录后来被星动纪元 Era0 的 64.33% 超越;GigaWorld-1 在 WorldArena 上登顶的说法则主要来自公司披露,尚需独立验证。但 51.67% 本身说明,真机任务仍远未解决,不能单独作为路线胜利的证据。
" 通过与已部署大量设备的机器人厂商合作,我们的模型能够快速实现规模化落地,并借助数据飞轮效应持续迭代系统能力。"Skild AI 的策略是分阶段推进:先在半结构化的工业环境中部署,收集数据后向更非结构化的场景扩展。据公开报道,2026 年 3 月,Skild AI 宣布与 ABB Robotics、Universal Robots 及 NVIDIA 合作,将 Skild Brain 嵌入已广泛部署的工业机器人中;同期与富士康合作,在 NVIDIA 休斯敦工厂的 Blackwell GPU 产线上部署双臂装配操作。
两种路径的共同前提是:真实部署本身正在成为训练场,而不是训练的终点。但一个更根本的问题仍然悬而未决。具身智能的 "AI Coding" 场景,即类似大语言模型领域中 Coding 那样高价值、高频、能够持续吸收模型能力的场景,目前尚无答案。
一种正在形成的判断是:这两件事最终需要同时发生。模型能力决定机器人能走多远,真实世界则不断告诉模型哪里还不够聪明。当预训练的规模效应与部署场景的数据回流真正形成闭环,机器人大脑才可能跨过从 " 会做一次 " 到 " 下一次做得更好 " 的门槛。

也许多年后回看,具身智能真正的分水岭,并不是某个模型在榜单上多拿几个百分点,而是行业终于不再用一次演示、一段视频、一轮融资来定义 " 智能 "。祛魅不是唱衰,而是让讨论回到可验证、可复现、可积累的轨道上——承认它会在陌生厨房里失败,也承认每次失败都在为下一次成功划定边界。
Figure 的 56%、极佳的 51.67%、墨奇的十五分钟,都只是路标,不是终点。真正值得期待的,不是突然出现一个无所不能的 " 机器人大脑 ",而是无数普通场景里,机器人一次次把事做成、又一次次暴露不足,再被工程和数据推着往前走。到那时,问题或许不再是 " 它有多聪明 ",而是 " 它今天比昨天多会干了什么 "。

追加内容
本文作者可以追加内容哦 !


登录后才可以发布评论哦
打开小程序可以发布评论哦