吴静 卢志坤 8小时前
当机器人开始“真上岗” 数据难题浮出水面
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

8 月,北京亦庄,世界机器人大会(WRC)上,300 余家企业、3000 余件展品,约 5 万平方米的展区被围得水泄不通。

《中国经营报》记者观察到,今年的场景和去年截然不同,机器人不再翻跟头炫技,而是在做咖啡、搬箱子、引导讲解。跳舞、变脸仍有掌声,但真正的焦点已转向搬运行李、分拣快递、自助洗衣、收纳杂物。" 花活 " 少了," 真活 " 多了。

今年,行业整体转向 " 真干活 "。然而,在这条人人可见的 " 明线 " 之下,一条更为隐蔽的 " 暗线 " 正在浮出水面——数据。展台上的机器人看似无所不能,但那套让它们 " 真干活 " 的智能系统,仍处在 " 数据饥渴 " 之中。

具身数据的百倍缺口

一组在 WRC 上被反复引用的数据是,当前国内真实物理交互场景合规数据仅 50 万小时,而机器人商业化落地需要数千万小时,缺口超过 99%。这不是一个可以被乐观情绪覆盖的数字,而是整个行业必须面对的结构性矛盾。

京东零售具身智能业务负责人郑小丹在大会期间披露,京东计划两年内建成全球最大的真实场景数据集,累计采集超 1000 万小时真实场景数据。这一目标的潜台词是:如果没有这 1000 万小时,行业的 " 大脑 " 训练难以为继。

为什么需要这么多?帕西尼创始人兼 CEO 许晋诚做了一个对比:" 人类数千年来积累的文本数据,才构成了今天语言模型的基础。现实世界的物理交互数据远没有这样的体量。" 他判断,千万小时级别的数据,可能是支撑机器人实现跨场景泛化能力的关键量级。

数据不会凭空产生。服务机器人企业擎朗智能创始人兼 CEO 李通点出了行业最深层的困境:" 得有机器人才有物理数据,没有数据就没有机器人,它就互相锁死在这个地方,是‘先有鸡先有蛋’的问题。"

这和 ChatGPT 的训练逻辑完全不同。大语言模型可以直接用互联网上现成的文本数据——人类数千年积累的文字,天然就是数字化的。但机器人需要的物理世界交互数据,在这个世界上并不存在现成的 " 数据库 "。拧瓶盖的手感、抓取软包时的力度控制、在复杂环境中避障的决策——这些数据只有让机器人在真实场景里 " 干起来 ",才能被采集。

优必选副总裁焦继超也印证了这一判断。当被问及当前行业最受限的环节时,他的回答不是本体硬件,也不是模型,而是场景数据。" 具身数据的维度比自动驾驶还要复杂——多模态、三维空间语义标签、时序对齐,现在大量依赖人工标注,效率低、成本高。"

他进一步指出,工业场景的数据获取比消费端难得多。工厂产线不允许机器人随意试错,一台机器人一旦在流水线上出错,可能导致整条生产线停摆。这让工业数据的采集成本和安全风险都大幅攀升。

更深层的问题在于,即便采集到了足够多的数据,机器人就一定能变聪明吗?

科沃斯集团董事长钱东奇在 WRC 上给出了一个冷静的判断:" 大语言模型的成功是靠海量数据+ 算力堆出来的,但这个逻辑能否迁移到物理 AI,没有人证明过。"

他进一步解释,大语言模型的 Scaling Law 成立有其特定条件——基于人类知识文字化与向量化。物理 AI 这条路能否走通,目前行业里并没有定论。" 卖算力的人当然希望你赶快做物理 AI,因为需要更大的算力。"

这不是否定数据的重要性,而是提出了一个更根本的追问:如果物理世界的规律无法被简单的 " 数据堆叠 " 所掌握,那行业投入巨资采集的海量数据,会不会只是在错误的假设上做正确的事?

三种路径填数据鸿沟

面对数据困境,行业正在从多个方向突围。

一种是真实场景采集。其中,京东的模式最具代表性。据郑小丹介绍,京东有 90 万名以上员工,包括物流小哥、家政阿姨、药师、零售店员," 我们通过激励方式让他们参与数据采集,成本上有天然的优势 "。京东物流员工已经在真实工作环境中佩戴第一人称视角设备进行数据采集。

帕西尼则在全国布局了天津、宿迁、武汉、自贡、赣州五座超级数据采集工厂,其中宿迁工厂即位于京东机器人产业园内。其自研的全模态数据采集系统可实现连续 8 小时采集不产生漂移。帕西尼还与京东云签署了战略合作协议,共同打造具身智能数据生态。

另一种是仿真数据。仿真能够降低试错成本、扩大训练规模,但许晋诚指出其局限:" 仿真环境很难构建出与真实数据同等级别的材质特性和噪声特征。想要构建完全仿真的世界,其造价甚至可能比实际采集真实数据更高。"

不过,真实数据与仿真数据并非替代关系,真实数据用于校准物理参数、验证系统效果和修正现实偏差,两者结合是目前主流的技术路径。比如银河通用首创 " 以合成仿真数据为主、真机数据为辅 " 的虚实融合训练范式;宇树科技在利用真实机器人运行数据的同时,也使用海量互联网数据进行预训练,并尝试将仿真训练与真机测试串联成闭环,推动模型持续自我迭代。

还有一种是无本体数据采集。自变量机器人在 WRC 展示了 QUANXTA Zero 方案——观众穿戴设备后,动作被捕捉并转化为机器人可学习的数据,数据入库有效率超过 85%,可将模型训练的数据成本降低 90%。奥比中光、觅蜂科技、他山科技等企业也在 WRC 上推出了各自的无本体数据采集方案。这条路径的核心逻辑是:让人类直接完成操作示范,再将动作数据 " 迁移 " 给机器人学习,绕过 " 必须先有机器人才能采数据 " 的困局。

目前,行业头部公司普遍采用多线并行的策略,例如在仿真环境中进行大规模预训练,再用少量高质量的真实场景数据进行微调,最后通过无本体采集方式快速覆盖新场景,以此构建一个高效、低成本的数据闭环。

即便数据被采集上来,也远未到可以安心使用的程度。

奥比中光董事长黄源浩在 WRC 上指出,当下行业最大痛点,是数据没有形成统一标准。不同厂商硬件采集的数据,视场角、帧率、精度各不相同,触觉、视觉之间时间同步精度参差不齐,甚至出现丢帧问题,最终导致 A 机器人采集的数据,B 机器人无法直接使用。

郑小丹也指出了数据开放的困境。在她看来,当前产业最稀缺的是真实场景下的高质量数据,单纯依靠本体采集或合成仿真数据,难以覆盖物理世界的多样性和动态变化。同时,京东虽然拥有丰富的场景资源,但部分数据与商业运营深度绑定,开放共享仍面临脱敏和合规的挑战。数据标准缺失、数据孤岛林立,让本就稀缺的高质量数据更加难以被有效利用。

当数据开始流动

不过,行业并非没有共识。WRC 期间,几乎所有受访者都在谈论同一个概念——数据飞轮。

李通给出的解法是 " 岗位化 " ——先找出对泛化能力要求不高的具体岗位让机器人干起来,在岗位上连续工作、稳定产出,用真实数据跑通闭环;机器人上岗后每天产生真实运行数据,形成 " 数据飞轮 ",持续反哺模型迭代。

星动纪元联合创始人席悦的判断也指向同样的方向:" 物流场景有明确的节拍、准确性和工作时长要求,做到这些,且 ROI 算得过来,厂家就愿意付费。" 当机器人真正在场景里 " 上岗 ",数据就开始回流。

北京人形机器人创新中心则通过开源平台慧思开物,让超过 200 家合作伙伴和高校在其技术基础上进行二次开发。平台整合了超过 200 万组场景数据,开发者可以调用这些数据进行模型训练和场景适配,同时在使用过程中形成的场景化应用也会持续丰富平台生态。

京东的路径最具规模效应:依托零售、物流、健康、家政等海量真实业务场景,京东计划两年内累计采集超 1000 万小时真实场景数据。郑小丹表示,真实场景数据是模型变强的关键,高质量数据的采集与处理已成为行业核心基础设施。

WRC 传递的信号清晰而明确:具身智能正告别实验室仿真和炫技展示,大步迈向规模化应用。

关于数据的追问始终悬而未决—— 50 万小时到数千万小时的鸿沟如何跨越?物理 AI 的 Scaling Law 是否成立?数据标准何时统一?这些问题的答案,将决定 " 真干活 " 究竟是行业拐点,还是又一次概念热潮。

(文章来源:中国经营网)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 物理 浮出水面 ceo 创始人
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论