人民网 5小时前
产业观察:具身智能,数据如何“止渴”?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

人民网记者 王震

当业界集体呼唤具身智能的 "ChatGPT 时刻 ",数据正成为整个行业最大的 " 渴点 "。

洗碗做饭、负重搬运、精密制造……在 2026 世界机器人大会上,机器人集体打工 " 班味儿 " 越来越浓。然而,热闹背后,一道现实考题亟待解答——具身智能如何摆脱 " 数据饥渴 ",真正走向规模化 " 上岗 "?

数据缺口,到底有多大?

真实世界的物理交互数据,是具身智能真正从 " 看懂世界 " 迈向 " 改变世界 " 的关键要素。

数据显示,当前国内真实物理交互场景合规数据仅 50 万小时,而机器人商业化落地需要数千万小时数据,缺口超过 99%。

这是一个从 " 十万 " 到 " 千万 " 量级的差距。

" 这种缺口,直接导致模型泛化能力不足。" 京东云总裁曹鹏表示,当前机器人产业仍处于爆发前夜,迟迟未能真正爆发,原因是机器人 " 大脑 " 的泛化性不足,而根源正是真实场景数据的匮乏。

数据供给,究竟卡在哪?

世界机器人大会期间,多家参展企业对记者表示——场景、成本是数据供给的核心卡点。

在 RoboScience 机器科学展台,同一套模型能够支持不同的灵巧手换装、作业。公司创始人田野介绍:" 这些抓取看似基础动作,却同时考验视觉理解、空间定位、接触判断与运动控制。"

" 物理世界的性质,通常很难通过其他模态获得。" 在自变量机器人创始人王潜看来,真实世界的物理交互数据具有 " 不可替代性 ",与互联网语言、视觉数据存在本质差异。

对初创企业而言,具身智能数据采集面临效率低、成本高两大核心挑战。比如,传统的真机数据采集依赖真实场景,不同场景难以复用;在成本方面,传统遥操作数据采集单条有效数据成本约 10 至 50 元,而训练一个机器人通常需要数万到数十万条数据。

数据困局,突破口在哪?

" 我们要建立统一的数据底座。"

开放原子开源基金会理事长谢少锋指出,当前数据格式的异构性导致了严重的数据孤岛,需要建立一套涵盖数据采集、标注、格式、质量的通用标准,构建大规模、多模态标准的数据集,源源不断地共享高质量的数据集。

墨奇智能联合创始人兼 CTO 黄青虬表示,当前行业接触到的具身数据质量是不够高的,并且缺乏统一的标准," 真实场景的数据质量,远比数据数量更重要。"

" 仿真是一个关键技术。" 在曹鹏看来,仿真技术可以进一步放大数据体量,同时能够高效地做效果评测,让模型使用过程中部署成本和模型训练成本都可以极大降低。

原力灵机联合创始人范浩强表示,核心突破口是 " 真机数据闭环 + 具身原生架构 + 仿真与合成数据联动 ":以高质真机数据建立物理直觉;利用物理引擎生成海量极端场景,补充长尾数据;在真实场景中先 " 跑起来 ",持续吸纳反馈自我迭代。

" 饥渴 " 背后,蕴藏机遇。

具身智能的 " 数据饥渴 ",也在催生新的机遇。本届大会期间,众多参展商宣布了关于数据采集的行动计划。

依托超级供应链,京东将在两年内采集超过 1000 万小时人类真实场景数据,同时采集超过 100 万小时机器人本体数据。

港股上市公司仙工智能正式成立具身智能数据子公司,依托超 50 万小时真机数据,专注打造真实世界数据基础设施。

在奥比中光展台,无本体 EGO 第一视角、UMI 手持操作、WristCam 腕部近场、Hub 同步中枢等数据采集硬件矩阵集中亮相。

……

当数据从 " 瓶颈 " 变为 " 引擎 ",具身智能的规模化落地或将迎来真正的拐点。谁能率先填平这道数据鸿沟,谁就有可能在这场智能革命中抢占先机。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论