
物理 AI 数据赛道迎来两个 " 行业第一 "。昨天,觅蜂科技第 20000 套 MEgo 无本体数据采集设备正式下线——这是行业第一次实现大规模化量产无本体数据采集设备;同时,觅蜂宣布累计生产超过 100 万小时高质量无本体数据,成为行业第一家拥有百万小时级、可对外售卖无本体数据的数据服务商。
仪式现场,觅蜂科技董事长兼 CEO 姚卯青同时宣布与腾讯 Robotics X 实验室达成无本体数据业务合作,为腾讯具身模型建设提供数据支持。
" 物理 AI 的数据电网,今天立下了第一根电线杆。" 姚卯青表示," 就像电网建成之后,电力才真正改变了世界——数据采集第一次有了基础设施,物理 AI 的数据,从此可以被规模化生产。"
六个月,两万套
觅蜂的量产速度在行业里并不多见。这家今年 2 月才成立的公司,最初只有几十人,却在 6 个月内完成了从产品研发到万台级量产的跨越。作为参照,智元机器人达到约 2 万台机器人量产用了三年半;虽然机器人本体供应链更复杂,但觅蜂半年做到 2 万台无本体采集设备,仍是物理 AI 数据赛道的标志性事件。

在姚卯青看来,这 2 万台设备意味着无本体数据采集第一次具备了规模化应用能力,可以进入真实场景,而不只是在搭建好的实验室里获取数据。目前,2 万套产品已陆续进入家庭、办公、零售、生产、餐饮等场景,约一半由觅蜂自持用于众包采集,另一半已销售给海内外用户。
伴随量产,觅蜂累计采集有效数据达到 100 万小时,全部来自开放环境,覆盖 22 大类场景、1 万余个真实环境、5 万余类物体和 500 余种细分任务。居住、办公、零售、生产等八大头部场景贡献约 82% 的数据,构成通用物理 AI 能力的核心基础;14 类长尾场景则拓展垂直行业覆盖。采集形态上,觅蜂形成了 Ego 裸手、Ego+Wrist 腕戴、Ego+UMI 夹爪三类数据体系,分别约 50 万、35 万、15 万小时,对应人类自然操作、腕部姿态与连续轨迹、机器人末端执行等不同需求。
物理 AI 的 " 数据墙 "
大模型的数据可以从互联网源源不断获取,但机器人最终要动手,真实技能只能来自经验,而这些经验在互联网上几乎不存在。姚卯青直言,与大模型相比,物理 AI 的数据量小了四五个数量级,真实度和丰富度也远远不足,且不可能完全在实验室里复刻。
过去一年,行业尝试过多种路径。传统采集需要搭建仿真环境、雇佣员工全天候操作,成本高、产能有限。京东科技集团副总裁何贺回忆,一年前采集物理交互数据,员工干 8 小时,真正有效的可能只有 1 小时,电费、人工、场地成本都很高。实验室数据分布也有限,难以覆盖阳光角度变化、物体凌乱、多人交互等真实世界复杂性。
无本体数据采集给出了另一条路径。MEgo 采用头戴超 300 ° 全景加腕部特写多视角设计,配合三维触觉和毫米级轨迹重建,让采集者在日常工作中顺便记录操作数据。姚卯青举例,食堂阿姨每天带着设备工作,8 小时可以采集五六小时的有用数据,而如果用真机采集,效率只有其 1/5。而且 MEgo 采集的数据还更有丰富度和泛化性——数千个餐厅工作人员采集的环境分布,不是一个实验室餐厅场景能比拟的。
硬件之后,闭环才是关键
2 万台设备构成硬件底座,但真正打破瓶颈的,是觅蜂跑通的从采集到训练的全链路体系。
真实世界动作复杂,手部出框、重度遮挡、高速运动、多人交互都是常态。觅蜂构建了 MEgo Engine 数据处理基础设施,并发布 HandPose 高精度手部重建技术。在遮挡、交互、快速移动等场景中,HandPose 七项核心指标达到 SOTA 水平,PA-MPJPE 重建误差较业界次优方案降低 62%,帧间抖动降低 93%。在奶茶制作场景中,即使手部被杯具大面积遮挡、可见率低于 30%,仍能实现亚厘米级三维重建和零跟踪丢失。
数据治理上,觅蜂没有走 " 过滤不合格数据 " 的老路,而是提出 " 不过滤,只分级 "。每一条真实数据都有价值,关键是找到合适应用场景。其 ManiEval 体系从数据类型、任务类型、传感器质量、语义质量、动作质量五个维度打分,将数据分为四类:精准数据用于策略模仿学习,丰富数据用于预训练表征,异常数据用于训练模型对错误的感知,长尾边界数据用于增强泛化与鲁棒性。
觅蜂还自研 REMORA 任务进度模型,让模型在真实运行中理解任务进度并识别错误异常;结合 Value Model 识别和筛选部署中的失败数据,将其中有训练价值的部分回流到数据体系。这意味着一次部署中的错误和失败,也能转化为下一轮训练的数据资产。由此," 采集—重建—质检—训练—部署—回流 " 的闭环被逐步打通。

目前,觅蜂百万小时级无本体数据已开始服务腾讯 Robotics X 实验室等客户。腾讯方面表示,无本体数据让模型更好地理解物理世界,对跨本体泛化具有重要价值。
从百万到亿小时:走向全民采集
"2 万和 100 万是觅蜂的里程碑,但我们更希望它成为行业的分水岭。" 姚卯青认为,通往 AGI,物理 AI 最终需要亿小时级数据。
从百万到亿小时,最大瓶颈在于运营模式升级。觅蜂希望从集中式采集走向社区化、全民参与。" 我们希望不是自己拍脑袋设计 100 个任务来训练机器人,而是发动人民群众,把独门绝技绝活都贡献出来。" 姚卯青展望,未来数据采集会像骑手、网约车一样,成为灵活就业平台,每个人的技能、时间、经验都可以变成可量化结算的资产。
这一图景正在落地。觅蜂的设备已撒向各行各业,不再局限于专业采集厂。随着设备成本下降、操作门槛降低," 每个人都可以成为数据采集员 " 正在临近。
产业层面,何贺判断,未来 1 至 3 年,物理 AI 数据产业将在生产、服务、家政、健康等场景更大规模推广。姚卯青则认为,数据产业可能比模型本身更先实现规模化和产业化。当更多参与者加入,数据积累将加速,最终推动物理 AI 从认知智能走向决策智能,让机器人真正 " 打卡上班 ",穿行货架、入户服务,走进日常生活。


登录后才可以发布评论哦
打开小程序可以发布评论哦