白鲸实验室 18小时前
GPT-6掀起具身智能风暴,恐慌与惊喜同时涌来
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

GPT-6 Astra 掀起的具身智能风暴仍在持续。

9 月初,OpenAI 发布 GPT-6   Astra,随后几天一段段机械臂视频在社交网络上传播。新模型无需额外训练,直接操控机械臂抓取,放置物体。独立评测机构 Robocurve 的实机测试显示,在双臂机械臂执行 " 抓取方块并放入碗中 " 的任务上,Astra 取得 95% 的成功率,明显高于 Claude Fable   5.1 的 40%。

接着,GPT-6 Astra 吃掉具身智能、大模型降维打击具身智能的说法迅速在圈内流传。

一位具身领域的创业者对我们说,最近行业群里讨论最多的就是这件事,有人觉得此前的一些具身路线要被推翻了。亚马逊 Alexa 首席科学家 Zeeshan Zia 公开断言," 机器人领域的 OpenAI 可能就是 OpenAI 本身,而不是 Physical Intelligence 或 Skild。"

国内互联网上,GPT-6 Astra 也点燃了具身领域人士发表看法的热情。前地瓜机器人具身负责人何泳澔(现为虚时科技 CTO)甚至认为,VLA、世界模型这类方案,可能已经没有太大投入的价值了,具身的突破大概率来自基模大厂。

" 这个冲击太大了,没想到那么快。" 何泳澔对我们说。

极佳视界首席科学家朱政几乎有着同样的判断,他在社交网站上写道," 语言模型已经吃掉了多模态,正在蚕食具身智能的路上,未来 1 到 2 年是关键点,具身智能团队必须加快节奏,现在具身智能没有什么真正的护城河。"

过去一周,Astra 成为具身领域的高频词汇,它掀起的风暴还吹到了外滩大会上。一夜之间具身模型公司的危机感似乎更重了。

共识与分歧似乎同样清晰,对具身而言 GPT-6 确实改变了一些东西,或者说正在改变一些东西。

01   

OpenAI 等模型公司从中国购买具身数据

大模型控制机械臂似乎并不新鲜。华为具身研究员钟子明告诉《白鲸实验室》,GPT-6 能控制机械臂本身是很 trivial(微不足道)的,机械臂的控制信号本质上就是上下左右和夹爪开合,不是 GPT-6 也能控制。

当然,这里面还存在一个成功率的问题,根据第三方评测,Astra 的成功率远高于 Claude Fable5.1 和其他模型。

更值得注意的是,在没有针对具身任务做修改的情况下,Astra 控制得比此前的专用模型如 π 0.5 更好。这也是令很多业内人士感到震惊的地方。

Astra 为什么能较好地控制机械臂执行任务,自变量机器人创始人王潜在外滩大会上给出了更根本的解释。他透露,从去年年初开始,OpenAI 和 Anthropic 就在大量采购机器人数据,并有自己的小规模数据工厂,还招募了不少机器人方向的人员。

" 一个非常好的多模态模型,里面加了很多机器人数据,能做这种事情好像真的不是什么特别奇怪的事情。" 王潜说。

晴岚视界 CTO 刘斯坦向我们证实了这一点,几个月前他们公司收到了很多数据订单,有的来自北美头部大模型厂商。" 他们做的事情就是给你一堆东西,让你指出这些东西的空间位置,谁在谁的左边、前面、后面,明显就是用来训练空间理解能力的。" 刘斯坦说。

因而,OpenAI 通过采购机器人数据训练出的新模型,让国内一众具身创业者折服就不足为奇了。不过它的表现也并不是那么完美。

破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲,认为 GPT-6 Astra 是相当惊艳的,他们团队在 Astra 可用当天就做了测试。

他给出的结论是,如果把具身任务拆成语义泛化、空间泛化和物理泛化三个维度,Astra 在前两项上很强,只在物理泛化上较弱。

Astra 甚至能抓起一根放在桌面上的筷子,这种小物体此前需要机器人顶住桌面、打滑才能抓起,还能把筷子立起来插进杯子里。但一旦涉及带物理接触的复杂任务,比如用筷子挑开东西、叠衣服、叠盒子,Astra 都是做不了的。

这就是当前的真实边界。Astra 证明了通用大模型可以解决具身中的语义理解和空间推理问题,但对于那些需要接触力、变形、摩擦的精细操作,仍然是专用具身模型的阵地。

刘斯坦并不认为 Astra 很惊艳。他在深圳的实验室和中山大学张瑞茂教授团队密集测试了 GPT-6,最后他的结论是,很多被认为只有 GPT-6 能做的事,拿 Gemini、Claude 或者千问,也能干。

为何这次讨论的比较多,本质上是大家对大模型能力在具身方向的一种新的发掘。换句话说,Astra 引起具身领域的恐慌中有一部分是认知差,大模型的能力边界一直被低估,而 Astra 很可能只是把它推到了物理世界的门口。

不过更多的人还是相信 Astra 很快将会改变一些什么,妙动科技创始人杨硕的预测代表了这种乐观派的判断。

他说,两个月内可能看到人形机器人带着 Astra 水平的 Agent 走来走去做家务,六个月内各 AI 模型公司的空间理解能力会逐步增强,甚至有人会谈论一种新的模型 Spatial-Language-Model ( SLM ) ,   把原本 Vision-Language-Model ( VLM ) 的空间理解能力大幅提升。

刘斯坦对此保留态度," 高频调用是不可能的,你给 GPT-6 说一个 hello 他都能想那么久,他怎么可能让机器人做家务?如果是低频率的规划思考,那其实我们已经在用了。"

大脑与小脑的分工

目前 Astra 还没能给具身领域带来实质性的改变,大多存在于猜想当中。真正值得关心的问题是,如果 Astra 不能替代具身模型,那它和具身模型之间应该是什么关系?

答案很可能是分层模型,分层模型被认为是和 VLA、世界模型不同的技术路线。上层是通用大模型,负责语义理解、任务规划和调度,下层是具身专用模型,负责感知、控制和物理交互。

华为具身研究员钟子明用一个具体场景解释了为什么必须分层。" 你跟机器人说帮我做个饭,它应该先规划做饭有几个步骤,然后说第一步我要找到锅铲,如果当前视角没有,就把拿锅铲这个任务打断,改成去找锅铲。" 这种调度能力,目前所有具身模型基本都没有。

而一旦锅铲掉了、被人拿走了,机器人需要判断并重新规划。这正是大模型擅长的纠错闭环。

类比大模型的发展,早期语言模型只能写一段代码,后来加上 Harness(执行环境),就能写完代码自己跑、跑出错误自己改。具身也需要这样一套 Harness,大模型做大脑,世界模型或 VLA 做执行,前者负责 " 做什么 ",后者负责 " 怎么做 "。

钟子明判断,Robot Harness 可能是具身下一个必然经历的阶段,只是目前具身还停留在相当于大模型写代码的那个阶段。

但这个架构有一个绕不开的工程问题,就是频率。

刘斯坦算了一笔账。人脑在静息状态下大概只有 15 瓦,思考时也不过 30 瓦,而一个跑在 4090 显卡上的大模型,能耗是几百瓦,而且推理频率极低。物理世界的运作有天然的高频要求,机器人保持平衡需要 50 赫兹以上的控制频率,也就是每 20 毫秒一次反馈。

" 你 20 毫秒输入的命令都还没到达 OpenAI 的服务器,机器人已经倒了。" 刘斯坦说。

他不认可 GPT6 对具身智能会产生多大的威胁,并用一个生动的比方解释了 GPT   6 控制机械臂," 现在 GPT6 做具身,相当于用大脑去干小脑的活。" 一个小脑受损的人,靠大脑思考每一步肌肉动作,也能扶着墙站起来,但这和人类真正多频率、高效节能的运动模式差得很远。

按照刘斯坦的说法,未来大模型内部会分化出不同频率的模块。他预测,也许到 GPT-8,云端大模型会划出极小的一块专门负责高频运动控制,通过 6G 网络和本体实时通信,把图像传上去,巨聪明的一个大脑,只激活那个神经系统的一丢丢,然后把动作发回来。

在那之前,端云协同是更现实的方案。机器人身体里跑一个高频的专用模型负责走路和操作,需要通用知识时再调用云端大模型的 API。" 我叫一个机器人教小孩子做作业,可能需要物理知识,这个时候调个 DeepSeek 的 API 就好了。正常走来走去干个活,这些都用不上。" 刘斯坦说。

刘斯坦和公司首席科学家正在研究的课题,正是这种分层的端云协同架构。

关于频率的问题业内也有一些人在思考。前地瓜机器人具身负责人何泳澔认为,未来可能会出现一种高频执行器,在一个很短的时空中,在确保没有 agent 反馈的时候能够继续流畅完成接下来的动作,大概率会是以小脑概念存在。

还有状态验证器,关键事件的判断,如失败恢复,细节处理,完成判定等。

这实际上意味着,具身智能的架构可能不会简单地变成 " 一个大模型包打天下 ",会逐渐形成不同频率、不同职责的分层系统。

大脑负责理解任务、规划路径和做高层决策,小脑负责高频、连续的动作控制。而状态验证器则像一个持续运行的 " 裁判 ",判断当前动作究竟有没有做对,任务进行到了哪一步,以及什么时候需要重新规划。

真正核心的可能还是数据

架构之上,决定胜负的可能还是数据。

今年是具身智能数据备受关注的一年。2026 年 4 月智源社区专访中,上海交通大学助理教授穆尧提出 " 数据为王 " 的概念,并认为 2026 年会是具身数据规模化的元年。

这个说法也得到了一些具身企业的响应。智元机器人孵化的觅蜂科技,其 MEgo 系列无本体采集设备已量产交付超 2 万套,累计产出超百万小时无本体数据,覆盖 22 大类场景、万余个真实环境和 500 余种细分任务。宇树科技则在 IPO 募投项目中明确将数据采集列为研发投入方向。

自变量创始人王潜在外滩大会上提出了一个判断," 今天智能的本体是存在于数据里面的,模型更多的是蒸馏器和容器。"

他认为,语言模型每一代的提升,一部分是因为模型的规模在变大,这个更多的是 Infra,更大的其实是因为越来越好的数据。Coding 先被解决,因为它是最容易制造和验证的数据,数学紧随其后,3D 和视频生成也因为相对容易标注而快速进步。

具身数据是最难制造、最难验证的一类,这既是壁垒,也是瓶颈。

2026 年关于具身数据路线的分歧已经公开化。例如苏度科技押注仿真,韩铮的团队在 2024 年重构了整套仿真数据管线,去年底在抓取、放置、组装类任务上实现了物体和环境几乎无限制下的接近 100% 成功率。

他的理由很朴素,真实数据收集效率慢、质量受限,仿真是绕不过去的。

蚂蚁灵波则更坚持真实数据。首席科学家沈宇军的论点是第一性原理的,机器人最终只能依赖身上的传感器做观测,而真实传感器一定有误差。他们测过很多真实传感器和仿真输出,基本上千差万别,不管是频率、幅值、传感器之间的一致性。

如果 Real-to-Sim(把真实传感器特性搬进仿真)不可规模化,那么只谈 Sim-to-Real 的差距缩小意义不大。

而在真实数据这边," 十万小时 " 的叙事正在被祛魅。华为具身研究员钟子明透露,某具身数据公司喊出十万小时,他实际下载下来只有一万小时。

什么才是好数据,正在成为具身智能行业最核心的竞争壁垒之一。数据怎么采、怎么筛、怎么配,以及哪些数据真正能提升模型能力,可能只有少数头部团队掌握了完整答案。好数据还必须和训练方式绑定,比如要做 ICL(上下文学习),数据里就得有 " 机器人做 " 和 " 人做 " 的对应关系。

" 具身到底想要什么样的数据,什么样的标注,这些基本都是黑盒。" 钟子明说。

比数据更深层的分歧是范式。沈宇军认为,具身不会简单复刻数字大模型的技术路线,数字世界的模型是轮次式的,你问一句,它答一句。但机器人必须一边工作一边推理,传感器输入 7 × 24 小时不间断。

这种从出发点就不同的应用场景,必然催生新的训练范式。

王潜则从更宏观的角度论证了具身不可替代。在他看来,人类科学研究有两种思维方式,逻辑推理和物理直觉,二者无法互相弥补。视频、3D、Code 都无法获得物理交互的能力,而真正的 AGI,乃至递归自我改进(RSI),都绕不开物理世界。

他描绘了一个五年后的场景,今天做一个 APP 可能需要一个大团队一年,未来一个人开一堆 Agent 几个小时就能完成。而造一架飞机,也许在具身智能和通用大模型的辅助下,也能像今天做 APP 一样简单。

回到最初的问题,GPT-6 会重做具身智能吗。

一个被多次报道的事件是,OpenAI CEO 奥特曼已经宣布要做人形机器人。如果大模型真能降维打击具身,OpenAI 没必要去做又脏又累的硬件,答案或许是,数据壁垒真实存在,物理世界的能力无法仅靠语言和视频获得。

OpenAI 需要身体去采集数据,正如它需要数据来喂养模型。

这反过来印证了王潜的判断。如果 OpenAI 做具身也要碰数据、碰硬件、碰真实世界的 evaluation," 那它只是另外一个具身智能公司而已 "。这些难度并不会因为它在基础模型上的优势而降低。

数据量无疑很重要,可一些数据在实际表现中似乎并不好,可能被高估了。许华哲直言,百万小时没有比几万小时训出更好的模型,另外,被低估的是整体智能模型的进展,或者具身智能模型的进展。

不过许华哲十分乐观,他觉得三年内具身智能就可以在很多地方开始服务,而且是通用的服务,不是在这儿后训练好的服务。

综合来看,未来最大概率或许不是谁吃掉谁,应当是分层共存。OpenAI 们做大脑,具身公司做小脑和身体,通过标准化接口协作。正如人脑本身,大脑负责思考,小脑负责运动,脊髓负责反射,各安其位,缺一不可。

文|吴寻

编辑|八尺

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机械臂 astra 机器人 外滩 亚马逊
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论