盖世汽车 前天
100万小时之后,机器人为什么还喊“饿”?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

100 万小时,还不够。

8 月 31 日,智元机器人内部孵化的控股子公司觅蜂科技,宣布 MEgo 系列第 2 万套设备正式下线,同时发布百万小时无本体数据集。这批数据覆盖 22 大类场景、500 余种任务类型、超过 1 万个真实场景和 5 万余个物体类别。

图片来源:觅蜂科技

此时,距离觅蜂科技成立不过半年时间,却已成为了行业首家对外宣布百万小时级别的无本体数据产能的公司。

但同一天,觅蜂科技董事长兼 CEO 姚卯青又把行业的下一阶段目标指向了另一个数量级:"通往 AGI,物理 AI 最终需要上千万、上亿小时的数据,今天只是起点。"

100 万到 1 亿,意味着 100 倍。

这个巨大的缺口,很容易让人产生一种熟悉的感觉。

过去几年,大模型行业已经经历过类似的 Scaling 叙事:更多数据、更大参数、更多算力,然后等待能力在某个节点突然涌现。

现在,这套逻辑似乎正在被搬到机器人身上。

于是,数采工厂越来越多,无本体设备开始量产,真实世界数据被按 " 小时 " 计算,百万小时之后又出现千万、亿小时的目标。

但一个更基础的问题反而值得先问:具身智能真的已经知道自己需要 1 亿小时什么样的数据了吗?

如果这个问题还没有答案,那么 " 百万小时 " 究竟意味着机器人距离通用智能更近了一步,还是仅仅意味着人类第一次具备了大规模生产物理世界数据的能力?

两者其实并不是一回事。

大模型的 Scaling,不能简单复制给机器人

机器人缺数据,这一点并不难理解。

语言模型拥有一个天然优势:人类过去几十年已经把大量知识数字化。

网页、书籍、论坛、代码、图片、视频,本身就是现成的训练材料。

但机器人最终要解决的是物理世界的问题。

怎么拿起一个杯子、怎样折叠衣服、怎样把不同材质的物品放进货架——这些人类习以为常的操作经验,并没有天然存在于互联网上。

姚卯青表示,目前物理 AI 的数据规模相比语言模型还小了 " 四五个数量级 "。在他看来,机器人真正的技能来自经验," 只有见过才会,才能再举一反三 "。

问题在于:" 机器人缺数据 " 和 " 机器人需要 1 亿小时数据 ",中间其实还隔着很远。

大模型 Scaling 成立的一个重要基础,是文本、图像等数据拥有相对成熟的 Token 化方式,模型架构、训练目标和评测体系也逐渐收敛。

物理世界却复杂得多。

同样是 " 拿起杯子 ",不同机器人可能拥有二指夹爪、五指灵巧手;不同本体的自由度、尺寸、力矩和控制频率都不同。人类完成一次动作产生的数据,也未必能够直接变成机器人的控制信号。

更重要的是,今天的具身智能甚至还没有完全回答一个基础问题:到底什么数据最有用?

是 1000 个家庭里各做一次叠衣服,还是一个机器人把叠衣服做 10 万次?

是人的第一视角视频更重要,还是机器人的关节轨迹更重要?

是让模型见过更多任务重要,还是让它把少数任务做得足够可靠更重要?

这些问题目前并没有统一答案。

所以,"1 亿小时 " 至少在今天还不能被理解为类似 " 训练某个模型至少需要多少 Token" 的工程结论。

它更多代表的是一种产业判断:如果具身智能最终需要通向开放世界的泛化能力,那么今天的数据规模远远不够。

至于究竟差多少,行业还在摸索。

为什么 " 无本体 " 偏偏在这个时候火了?

也正是在这种背景下,无本体数据开始迅速升温。

过去获取机器人数据,一个最直接的办法是让机器人自己干。

操作员通过遥操作控制机器人完成抓取、搬运、整理等任务,机器人看到什么、关节如何运动、末端执行器经过怎样的轨迹,都同步记录下来。

优点是数据天然贴近机器人。

缺点同样突出——生产效率太低。

京东科技集团副总裁何贺在现场回忆,一年前进行物理世界数据采集时,操作员带着机器人工作 8 小时,最终可能只有 1 小时有效数据,同时还要承担机器人、电费、人工和场地成本。

姚卯青则给出了另一个数字:现在几万小时真机数据已经成为一些模型比较普遍的需求,而几万小时真机数据,可能就需要上千台机器人持续采集半年。

这恰恰暴露了一个矛盾。

一边是行业开始相信数据应该 Scaling;

另一边是传统数据生产方式根本 Scale 不起来。

无本体数据,本质上是在解决这个矛盾。

人不再需要遥操作一台真正的机器人,而可以佩戴第一视角、腕部设备,或者拿着夹爪直接完成任务。

觅蜂此次公布的 100 万小时数据中,50 万小时来自裸手采集,35 万小时来自腕部采集,15 万小时来自 Gripper 夹爪采集。

现场食堂里的对比更加直观。

传统遥操作 8 小时可能得到 1 小时有效数据,而餐饮、保洁工作人员正常工作时佩戴设备,8 小时最多可以产生 5 — 6 小时数据。

所以,无本体的出现首先解决的并不是 " 机器人怎样变聪明 "。

而是一个更加现实的问题:怎样把物理世界的数据生产成本降下来。

这是两个完全不同的问题。

能够便宜地生产 100 万小时数据,并不意味着这些数据一定能够带来与数量成比例的模型能力提升。

这也是看待此次 " 百万小时 " 最需要区分的地方。

它首先证明的是数据生产能力,而不是模型能力。

100 万小时最大的价值,可能不是 "100 万 "

事实上,即使是觅蜂自己,也没有把所有筹码押在小时数上。

此次公布的 100 万小时数据同时强调了 22 大类场景、500 余种任务、超过 1 万个真实场景和 5 万余个物体类别。

这背后其实暴露出具身智能 Scaling 与大模型 Scaling 一个非常不同的问题:物理世界的数据很难只用 " 小时 " 衡量。

两个数据集都可以叫 100 万小时。

一个可能来自大量重复任务,另一个可能覆盖完全不同的环境、物体和操作,两者对于模型的意义显然不同。

同样,一段 30 分钟的数据里,也可能真正有价值的操作只有几分钟。

所以小时数是最容易理解、最容易传播、也最容易被产业统计的指标,却未必是衡量具身数据价值最准确的尺度。

这也是为什么,今天看到 " 百万小时 "" 千万小时 "" 亿小时 " 这些数字时,需要保持一点距离。

它们说明供给规模正在迅速扩大,却不能直接等价为机器人能力的提升。

真正需要观察的是另一条曲线:

当数据从 10 万小时增加到 100 万小时,模型到底提升了多少?

成功率提高了吗?

没有见过的环境中,泛化能力提高了吗?

换一个机器人本体之后,原来学到的能力还能保留多少?

过去不会做的任务,因为这些数据学会了吗?

如果这些问题没有对应答案,那么数据规模本身很容易变成一个漂亮但缺乏解释力的产业 KPI。

至少此次发布会上,觅蜂更多展示的是数据规模、覆盖范围、采集和治理能力;至于百万小时数据能够给某个具体模型带来多少能力增益,现场尚没有给出一组可以与数据规模直接对应的完整结果。

因此," 行业首个百万小时 " 值得记录,但它还不是一个类似 " 大模型参数跨过某个节点之后出现能力涌现 " 的技术证明。

这是需要分清的。

机器人需要的,到底是 " 见得多 " 还是 " 练得多 "?

再往前一步,具身智能还有一个比数据量更根本的问题。

人的学习并不是简单复制过去见过的所有动作。

一个人第一次学会打开某种抽屉之后,换一间房、换一个把手、换一个高度,大概率仍然知道 " 拉开抽屉 " 这件事情应该怎么做。

机器人追求的最终也是这种能力。

也就是泛化。

从这个意义上说,真实世界大规模数据的价值很好理解:

实验室可以搭一个餐厅,却很难搭出 1000 个不同的餐厅。

真实世界里的光线、桌面高度、物品位置、人流和干扰每时每刻都在变化。机器人见过的环境越多,理论上越有机会学习到任务背后更加通用的规律。

这也是无本体数据最有吸引力的地方。

它把数据源从有限的机器人实验室扩展到了真实世界。

但这仍然只解决了一半问题。

见得足够多,不等于做得足够好。

人类的身体和机器人不同。

人的操作经验可以告诉模型 " 杯子应该这样拿 ",却不能天然保证某台机器人知道自己的几个关节应该转多少度、夹爪应该施加多少力。

因此,无本体与真机之间并不是简单的替代关系。

姚卯青在群访中也承认,无本体更多用于预训练和通用表征学习,而真正针对具体机器人、具体任务进行后训练和落地时," 肯定绕不开对应本体的真机数据 "。

腾讯 Robotics X 实验室产品生态负责人朱亚娟的说法也很谨慎:无本体的 " 异构 +Gripper" 可以" 一定程度上 "替代过去通过本体遥操作解决的问题,但跨本体迁移中精细动作的对齐,仍然需要真机数据来校准。

这两个限定词其实比 " 百万小时 " 更值得关注。

因为它说明,行业现在仍然没有找到一种可以包打天下的数据。

机器人既需要 " 见得多 ",也需要 " 练得多 "。

而这两种需求究竟应该如何组合,目前仍然处于探索阶段。

具身智能的 "Scaling Law",还没有被证明

所以,回到最开始的问题:100 万小时,还不够机器人 " 吃 " 吗?

答案可能是——至少在今天,这个问题还没有答案。但真正值得注意的是另一件事:行业已经开始用 " 数据规模化 " 来回答这个问题——而规模化本身,也可能成为答案的一部分。

姚卯青认为,上亿小时才能预训练出足够好的具身基座模型。

这个判断并非没有逻辑。

如果目标是让机器人进入家庭、商场、工厂、仓库乃至更多开放环境,那么它面对的物体、任务和环境组合几乎无限,现有数据显然远远覆盖不完。

但从 100 万到 1 亿之间,并不存在一条已经被验证的 Scaling Law。

1000 万小时是否会出现能力跃迁?

5000 万和 1 亿有什么本质差异?

模型架构进步之后,数据需求会不会反而下降?

不同数据之间应该按照什么比例组合?

这些问题目前都没有确定答案。

因此,此次百万小时数据更准确的意义,或许不是证明 " 机器人距离 AGI 又近了 1%"。

AGI 不是一个可以简单用数据小时数计算的进度条。

它真正说明的是另一件事情:

物理世界的数据,正在第一次具备被工业化生产的可能。

两万套采集设备、百万小时数据、真实场景采集,以及越来越专业的数据加工链路,共同指向一个新产业正在形成——人类过去没有被记录下来的物理操作经验,开始被系统性地数字化。

至于这些数据最终能在多大程度上推动机器人能力 Scaling,仍然需要模型训练和真实部署来回答。

所以,对于今天的具身智能而言,真正值得警惕的不是数据太多,而是过早把 " 数据规模扩大 " 和 " 智能能力提升 " 画上等号。

百万小时之后,行业当然还会继续追逐千万小时、亿小时。

但下一阶段需要证明的,不应该只是数字还能不能继续变大。

而是机器人是不是真的因此变得更聪明了。

换句话说:数据产能的工业化,与智能能力的涌现,是两件独立的事。 前者正在发生,后者仍待验证。而把两者混为一谈,恰恰是当前具身智能叙事中最需要警惕的部分。

当然,在证明这一点之前,还有一个更加现实的问题。

如果行业真的准备向 1 亿小时迈进,剩下的 9900 万小时,到底从哪里来?

这将是这个系列下一篇要讨论的问题。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 物理 ai 技能 ceo
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论