雷锋网 昨天
具身智能落地的最后20%,藏在「云」里
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

今年的 WAIC 和 WRC,具身智能展台的风向变了:不再执着于炫技,转向务实。

去年的画风还是十八般武艺,同台竞技——机器人跳街舞、格斗秀、走猫步等;而今年则是走进真实场景:机器人开始被放进物流、工业、家庭等具体任务里。

过去一个多月,雷峰网一线走访了灵初智能、艾欧智能等具身智能公司,也看了各厂商在展台上的演示,一个感受越来越强烈:真实场景里的任务,远比 Demo 脚本复杂得多。

在走访和交流中,雷峰网 ( 公众号:雷峰网 ) 也与多位云专家进行了交流。当被问及机器人落地、商业化时,一位云专家表示,具身智能存在明显的 " 长尾效应 ":前 60%、70%、80% 的进展可能很快,但最后 20% 却需要花非常多的时间填补。

而这最后 20%,藏在真实场景里,也藏在云基础设施要解决的难题里。

从展示能力到完成任务,两者之间隔着一整套复杂的系统。这套系统要面对的,是真实世界的各种 " 意外 "。比如,网络可能不稳定,机器人可能遇到没见过的情况;每天产生的数据需要回传、处理和训练;当机器人无法自主完成任务时,还需要人工远程接管。

机器人一旦开始真正 " 干活 ",需要的就不只是一副好 " 躯体 "。背后一整套支撑连接、数据、算力、模型乃至 Agent 的云基础设施,同样不可或缺。

云厂商的新机会,就在这里。

让机器人 " 上云 "

今天的机器人,离完全自主还很遥远。当机器人超出自主能力边界时,就需要人工接管。问题在于,如果人和机器人不在同一个地方,怎么实现远程控制?

艾欧智能的遥操作业务,就是从这里切入的。

联合创始人丁哲章回忆,艾欧最初做的是本地操作,操作员就在机器人身边。这种模式并不需要通过网络进行远程传输,甚至不需要太多算力,用端侧方案就能解决。但当业务扩展到远程场景后,新的技术需求随之出现:

控制流、图像流需要稳定、安全地传输,同时还要在弱网条件下提供基础保障;数据的处理和传递,也需要云端算力来辅助加速。

因此,遥操作看起来只是人在远端控制机器人,背后却需要一套完整的中间传输技术栈。

" 我们当时确实需要一个稳定、好用、并且能够深入配合的中间技术栈,来确保远程遥操作这件事能够稳定地跑下去。" 丁哲章说。

腾讯云的 TRRO(Tencent Cloud Remote Real-Time Operation,腾讯云远程实时操控)方案接入了这部分需求。此后,双方又在入口、平台功能和遥操作方案上做了多轮打磨,进一步降低传输延迟、优化控制效果。

具身智能落地时,艾欧需要面对不同场景和机器人本体的适配问题。而处理这些差异,需要腾讯云相关团队参与,推动云、边、端之间的协同。

腾讯云异构计算产品副总监黄阳、存储高级产品经理李沐霖向雷峰网介绍,在具身智能系统中,具身智能系统本身就体现出明显的 " 异构 " 特征:

任务理解、场景理解等" 慢反应 "任务交给云端大脑来处理,使用高性能 GPU 进行训练和复杂推理;而运动控制、实时响应等" 快反应 "任务则放在本体边端,用 NPU 或 CPU 部署相应的小模型,成本更低、延迟更短,满足小模型推理需求。

云端在这里解决的,是一个基础性问题,即如何让机器人被稳定地连接、控制,并与云端算力高效协同。

数据是块 " 硬骨头 "

机器人真正连上云之后,需要面对另一个问题:数据怎么处理?

灵初智能是较早遇到这一问题的公司之一。联合创始人陈源培提到,灵初刚成立时,数据量并不大,直接在本地存储,采集后自己使用即可。但随着数采规模扩大,一个数采厂每天可能产生百 GB 级数据,数据存储、传输和处理等基础设施需求迅速增加。

" 对于创业公司来说,自己 handle(处理)性价比很低,上云、跟云厂商合作是更合适的选择。"

腾讯云存储解决方案专家架构师杨冠军把双方的合作概括为数据平台、训练平台和音视频三个层面:数据从数采厂和客户现场回流后,需要经过治理、存储、加工,再导出训练,同时还涉及远程运维和跨网络的音视频传输。

具身数据本身,也比传统图片、视频更为复杂。以灵初为例,每个 Episode(一次完整任务执行的记录)都包含 Task、Action 等结构,同时记录视频、关节数据、控制命令和标注等信息。

当灵初想针对某个场景做模型加强或特色训练时,问题就变成了:数据在哪?怎么从海量数据里快速找到对应的那批?怎么导出来交给训练?这些都是云上需要解决的难题。

这些问题并非灵初独有,灵生科技也面临类似挑战。

合伙人、世界模型训练负责人蒋玉骅提到,灵生正在做 VLA 和 WAM 两种范式的转换和迁移,面临的一大难题便是数据存储问题。从图片到视频,数据规模越来越大,甚至还会出现存储碎片化、数据难以检索等问题。

另外,为了最大限度发挥数据的价值,灵生还希望实现 " 数据训练模型、模型又反过来帮助处理数据 " 的双向驱动,这也对云提出了新的要求。

灵生训练数据的来源非常多元,既包括 EGO(Egocentric Data,第一人称视角数据)、WOMI(World-Oriented Manipulation Interface)等数据,也包括跨本体数据,涵盖机械臂、灵巧手等不同本体形态。更复杂的是,数据采集、下载和模型训练常常同步进行,这也就意味着一边不断有新数据汇入,另一边训练任务又在持续读取。

蒋玉骅提到,这就要求数据能流式加载,既要保证数据完整性,也要过滤掉低质量或未经预处理的数据。这些能力的实现,高度依赖高效的检索机制,以及存储层与 Memory 层之间的协同。

这也是腾讯云在灵生世界模型预训练阶段发挥作用的关键环节。

当 Agent" 掌控 " 机器人

当 Agent 真正运行在机器人身上,云需要解决什么问题?

元点机器人和腾讯云的合作,是一个观察切口。

联席 CTO 李元庆介绍,元点机器人对未来机器人的产品形态有一个颇有意思的划分—— Pet、Partner 和 Assistant,即提供情绪价值的 " 宠物 "、兼具情绪和功能的 " 伙伴 " 以及承担更多功能的 " 助手 "。

这些功能和场景,都可以通过 Agent 进行调度。当 Agent 进入机器人系统后,机器人便开始具备理解用户需求、生成 Skill 并自主调度任务的能力——这正是元点机器人上半年接入腾讯云 ClawPro 后探索的重点方向之一。

李元庆和腾讯云计算专家产品架构师萧一修举了一个例子:

用户只需要说一句话 " 以后看到哪只股票上涨,就让机器人来到我的位置,然后跳一段舞。" 在传统机器人体系里,这可能意味着开发一个新的功能;但在 Agent 体系里,它可以被转化成一个 Skill,由 Agent 完成调度,再交给机器人执行。

这也就意味着,机器人不再只是执行预设动作,而是开始执行由用户定义的任务。

值得一提的是,ClawPro 支撑的是多种智能体的统一部署、管理与运维,而要让 Agent 长期稳定运行,还需要更底层的运行时能力支撑,这也是腾讯云 Agent Infra 需要解决的 Runtime 问题。

腾讯云存储总经理陈峥介绍,Agent Runtime 背后主要由四层能力支撑:Agent 沙箱提供运行环境,Agent Bucket 提供独立数据空间供 Agent 存取个人数据,Agent Memory 负责沉淀长期记忆,Agent 安全体系则承担权限管控与鉴权。

简言之,Agent Runtime 可以为机器人提供可长期运行、具备记忆,并能够安全调用数据和资源的底层能力,是元点机器人实现 Pet、Partner、Assistant 机器人形态进阶的关键底座。

结语

不难看出,云正在成为机器人落地,乃至未来规模化过程中越来越重要的基础设施。机器人需要云来承接数据,需要云来提供算力,需要云来支持远程连接,也需要越来越多 Agent 能力在云端运行。

在此次走访中,谈到具身智能时,李元庆曾借用一个形象的比喻:机器人落地像一个拳头,数据、算力、模型、场景和机器人本体,是五根手指。五根手指握在一起,才是一个完整的拳头;任何一根缺失,拳头都握不实。

可见,具身智能产业化更像是一场系统工程,也恰好是云厂商的机会所在。当云成为更坚实的基础设施层,它提供的不只是简单的算力或存储,而是能让五根手指真正握成拳头的 " 向心力 "。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 腾讯云 基础设施 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论