通信世界 5小时前
GPT-6“调用”宇树G1:AI智能体与实体终端融合,通信产业迎来新变量
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

日前,斯坦福团队发布的 HomeBody 项目展示了一个值得产业界重视的进展:GPT-6 Astra 与宇树 G1 人形机器人连接后,能够在从未见过的厨房中完成探索、建图、物品归置、丢弃纸盒,甚至根据 " 把药拿来 " 的指令找到不在视野内的药品并递到人手中。与以往桌面级抓放演示不同,该系统在新环境中无需额外采集训练数据,也无需重新训练专用动作策略,而是让大模型把导航、抓取、开抽屉等机器人技能当作工具来调用。这意味着,AI 智能体与实体终端的融合正在从单点验证走向开放环境下的系统集成,也为通信、算力与机器人产业的协同提出了新命题。

从桌面到厨房:机器人任务链被显著拉长

过去一段时间,大模型控制机器人的演示多集中在桌面机械臂抓取、放置等短程任务。HomeBody 则将任务范围扩展到了开放厨房:机器人需要先理解空间,再记住物体位置,最后把行走、抓取、放置、开抽屉等动作串联起来。

具体来看,系统先让 G1 进入陌生厨房探索。Astra 会选择值得观察的位置,引导机器人移动,同时记录相机画面、激光雷达扫描、关节姿态和途经位置。借助 SLAM 能力,机器人一边建立地图,一边确定自身位置,这些观察结果被保存为后续可调用的空间记忆。

随后,Astra 还要在 Isaac Sim 仿真平台中构建一个数字厨房。这个数字孪生并非只追求视觉相似,而是将 SLAM 测得的几何信息纳入重建过程,用真实测量约束虚拟模型。系统再把真实定位地图与数字厨房对齐到同一坐标系,并将相机画面、内容描述和空间位置关联起来。这样,机器人之前看到的抽屉就不只是 " 见过 ",还对应着一个可以返回的具体位置。

到了执行阶段,用户只需给出自然语言目标,例如 " 收拾厨房 "" 把咖啡袋集中到中间 "" 丢掉指定纸盒 "。Astra 会结合当前画面、地图、空间记忆、机器人手持状态以及上一步执行结果,决定下一步调用哪项技能、操作哪个目标。取药演示中,药品并不在当前视野内,但系统能从保存的关键画面中找到抽屉线索,再调用导航、开抽屉、取药等技能,把任务接续完成。

这一变化的关键在于,机器人不再只判断眼前抓什么,而是开始具备空间记忆、任务规划和多技能编排能力。对产业而言,这比单次抓取成功更具价值,因为它指向了开放环境中的长程操作。

技术路线分野:大模型从 " 动作生成者 " 变为 " 技能调度者 "

HomeBody 最值得关注的,是它调整了机器人系统中决策与动作之间的连接方式。

传统机器人系统常被划分为三层:System 2 是视觉语言模型,负责理解指令和决定做什么;System 1 是视觉语言动作模型,负责生成动作命令;System 0 是底层控制器,负责协调身体执行。简单说,就是 " 安排任务—生成动作—控制身体 "。

此前 Robocurve 让 GPT、Claude 控制机械臂,是由模型根据相机画面和机器人状态,直接指定夹爪位置、朝向和开合状态,再由底层模块转换成关节动作。Anthropic 则测试过让语言模型接收、修改甚至替换 VLA 提出的动作。HomeBody 选择的是另一条路径:让 System 2 直接调度技能库,由技能模块规划具体动作,再交给底层控制系统执行,不必经过一个学习型 VLA。

这些技能库里装的是已经写好、可复用的电机技能,例如导航、抓取、放置、开抽屉、从抽屉中取物等。它们有统一接口,大模型只需告诉技能 " 去哪里、抓什么、放到哪里 ",技能自己执行,执行完再把结果反馈给大模型。抓取技能内部会完成目标圈定、深度估计、三维位置计算、抓取姿态规划、避障和运动执行。GPT 决定抓哪个、用哪只手,技能模块解决手怎么伸过去、怎么抓起来。

这种架构的优势在于模块化、可复用和可解释。新环境不必重新训练一套专用动作策略,技能库可以在不同任务间复用,执行偏差也能由技能模块先自行调整和重试。但它同样有前提:现成的感知模型、运动规划器和预训练控制器仍然是机器人能把活干起来的基础。HomeBody 使用预训练的 AMO 控制策略,让下半身运动同时考虑上半身动作目标,协调行走与操作。

从通信与算力视角看,这一架构天然带有云边端协同特征。Astra 在远端负责决策,感知、规划和技能执行运行在一台搭载 RTX 4090 的笔记本上。任务执行时,模型推理会让动作之间出现等待。未来如果要走向规模化商用,云端智能体、边缘算力节点和机器人本体之间的时延、可靠性和数据同步能力,将直接影响用户体验。

产业落地价值:服务机器人、工业巡检与物流场景率先受益

HomeBody 展示的能力,虽然发生在厨房,但其可迁移场景并不局限于家庭。

能够记住不在眼前物品的位置,能够把多步骤任务串联起来,能够用自然语言接收目标并动态调整执行顺序,这些能力对家庭服务、商用清洁、仓储物流、工业巡检、养老助残等场景都具有直接价值。例如,在仓储环境中,机器人需要根据指令找到特定货品,途中可能还要完成关抽屉、避障、放置周转箱等动作;在工业巡检中,机器人需要按计划路线移动,并在发现异常时返回特定位置进行复核。开放环境长程操作能力,是机器人从 " 演示品 " 走向 " 工具 " 的关键一步。

对通信行业而言,机器人正在成为新型智能终端。它不仅是连接网络的设备,更是需要云端模型、边缘算力、数字孪生、空间数据和实时控制协同的复杂系统。运营商和通信设备商可以切入的环节包括:算网融合服务、边缘推理节点、确定性网络、网络切片、数据安全与隐私保护。随着模型推理成本下降,具身智能的经济性也会逐步改善。相关评测中,GPT-6 Sol 平均得分达到 GPT-5.6 Sol 的 1.6 倍,成本低约 47%;Opus 5.5 平均得分约为 Opus 5 的 1.8 倍,与 GPT-6 Astra 接近,单次成本低约 21%。模型能力提升与成本下降,正在为机器人云端决策提供更现实的商业基础。

中国视角:本体制造有优势,云边端协同是关键

宇树 G1 作为国产机器人平台出现在这一项目中,本身就是一个值得关注的信号。它说明中国企业在机器人本体、运动控制、供应链和成本控制方面已经具备较强竞争力。具身智能的产业链并不只是大模型,还包括执行器、传感器、关节模组、电池、轻量化材料和整机制造。中国在这些环节拥有较完整的产业基础。

与此同时,国内 5G-A 商用和 6G 研发持续推进,边缘计算、算力网络和云网融合布局不断深化,这些基础设施可以为具身智能提供低时延、高可靠、广覆盖的连接与算力支撑。国内大模型也在快速发展,华为、阿里、字节、深度求索等企业均在推进各自的技术路线。政策层面,具身智能已被视为未来产业方向之一。若能把国产机器人本体、国产大模型、算力网络和场景数据结合起来,中国有机会形成 " 本体 + 模型 + 网络 + 场景 " 的闭环。

但差距同样存在。机器人技能库接口尚未统一,机器人操作系统碎片化,云端推理的安全隐私和实时性仍需验证。通信行业如果只把自己定位为 " 管道 ",很可能错过智能体与实体终端融合带来的平台机会。更现实的路径是,联合机器人厂商、模型企业和行业用户,推动技能接口、数据格式、云边端协同协议的标准化,并在边缘算力、网络切片和安全体系上提前布局。

冷静边界:泛化性提升不等于零成本部署

HomeBody 的确展示出较强的泛化能力:部署到新厨房时,系统不需要额外采集训练数据,也无须再训练一套专用动作策略。但这不等于整套系统从未训练过,也不意味着部署和运行没有成本。

数字厨房的前期重建需要准备时间和 API 成本;实际执行任务时,模型推理会让动作之间出现等待;长时间干活还要过硬件关,例如手指舵机过热就是当前限制之一。感知、规划、技能执行和底层控制仍然依赖一整套复杂系统。换句话说,把 GPT 接上宇树机器人确实能让机器人进厨房干活,但距离 " 买台机器人、登录 GPT API,坐等它做家务 " 还有很远。

这也是行业媒体需要保持冷静的地方。单点 demo 可以展示方向,但产业落地取决于可靠性、耐久性、成本、安全以及可维护性。HomeBody 的价值,不在于它让机器人收拾了一次厨房,而在于它提供了一种可复制的架构思路:大模型作为智能体负责理解与调度,技能库作为中间层负责动作规划,实体终端作为执行体负责物理交互,云边端协同作为支撑负责算力与连接。

结语

GPT-6 Astra 接入宇树 G1,表面看是一次机器人进厨房的演示,深层看则是 AI 智能体与实体终端融合的一次系统性尝试。它把大模型的能力从数字世界的对话与生成,延伸到了物理世界的感知、记忆、规划和执行。对通信产业来说,这意味着网络需要从 " 连接人 " 进一步走向 " 连接智能体与机器 ",需要为具身智能准备更低时延、更可靠、更安全、更弹性的云边端协同底座。

当大模型开始调用机器人技能,机器人开始记住空间并执行长程任务,产业竞争的重心也将从单一模型能力,转向 " 模型 + 本体 + 网络 + 场景 " 的综合能力。谁能率先打通这套体系,谁就更有可能在具身智能的下一阶段占据主动。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 astra ai 技能
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论