IT时报 昨天
宝妈、外卖小哥戴上头盔为机器人“生产数据”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

众包模式入局,接棒具身数据下半场

作者/   IT 时报   沈毅斌

编辑/   郝俊慧  孙妍  

在具身智能兴起的几年间,大量具身智能数据采集中心拔地而起,人形机器人在其中反复练习行走、抓取,获取最基础的场景训练数据。但今年下半年,业界对数采中心的热情开始降温。

坐落于北京首钢园的北京首家人形机器人数据训练中心近期停运,原运营方睿尔曼智能撤出全部自有设备与机器人,成为数采中心第一轮洗牌的缩影。

与此同时,觅蜂科技发布觅蜂派 App,以众包模式扩大数据采集网络。在杭州、苏州等数十个城市,许多普通人开始戴上轻量化头戴设备,把做家务、理货、做手工的日常过程记录成数据。不用懂算法,不用进实验室,只要按任务要求完成操作,就能按有效时长获得报酬——分散在千家万户的真实场景,正在成为具身智能数据新的供给源。

一边是集中式数采厂的关停潮,一边是全民众包的新生路,具身智能的数据采集赛道,正经历商业模式的深层重构。

数采中心泡沫破裂

2025 年,具身智能从概念快速走向落地,真机交互数据、第一视角动作数据的需求集中爆发,使得集中式数采中心成为最先跑通的商业模式,不少地方产业园甚至将数采基地作为招商标配," 建数采厂 " 一度成为赛道风口。

调研机构 Interact Analysis 报告显示,截至 2026 年 4 月底,国内已有至少 90 个人形机器人数据采集和训练中心处于使用或规划建设中;中国信通院人工智能所发布《具身智能训练场研究报告(2026 年)》也显示,截至 2026 年 6 月底,全国建成启用超 70 家训练场,在建或规划中的训练场 46 家。

租下一片场地,搭出家居、仓储、分拣等模拟场景,采购一批机器人本体或动捕设备,雇用专职操作员做动作示范,采集完成的数据打包卖给模型厂商。这套标准化的复制路径,让 " 月产千小时数据 " 的故事在行业里反复上演。

场景建得多,但真正能让具身智能落地的应用数据却极其稀缺。

近日,被称为 " 具身智能眼脑手第一股 " 的企业梅卡曼德,其创始人兼 CEO 邵天兰在朋友圈发文表示,行业里有很多 " 攒局型 " 具身智能企业,利用所谓 " 数采中心 " 和与投资方、供应商的关联交易来制造虚假的、不可持续的收入。

此番言论刺破了数采中心的泡沫,也让业内开始重新审视这种重资产模式的合理性。而数采中心集中式采集模式的困境,本质上是三重天生短板的集中暴露。

首先是成本刚性难题。一座标准的真机数采中心,仅机器人本体、动捕设备、场地装修的前期投入就达数百万元,再加上人员薪酬、设备折旧、运维损耗,单小时数据的采集成本长期居高不下。更关键的是产能几乎没有规模效应,要提升数据产量,必须等比例增加机器人、场地和操作人员,投入和产出基本呈线性关系,很难通过扩张来摊薄成本。

其次是场景同质化困局。绝大多数数采厂的模拟场景都集中在叠衣服、搬箱子、包裹分拣等少数通用任务中,数据重复度极高。" 很多单个模型和具身智能公司都在使用百万级小时数据,但类似叠衣服的数据已经泛滥,不需要了。" 觅蜂科技 CEO 姚卯青在接受《IT 时报》等媒体采访时直言,真正稀缺的精密装配、非遗技艺、特殊工况等细分场景,要么搭建成本极高,要么根本无法在封闭的模拟场地里复刻。

最后是质量参差不齐。行业仍处于野蛮生长阶段,不少团队用手机、运动相机凑数,帧率不达标、空间精度差、时间同步错位等问题普遍存在。随着头部模型厂商对数据要求提升,这类 " 水货数据 " 迅速失去市场。" 年初大家还广撒网试各家数据,现在头部客户都开始定点独家采购,数据杂了反而会‘毒’模型。" 姚卯青说。

当然,集中式数采并非就此失去价值。针对特定机器人本体的后训练数据、高精度真机遥操作数据,依然需要通过专业数采中心完成。只是这一市场容量有限,且已被头部玩家瓜分,大批跟风入局的中小玩家,自然成为泡沫破裂后最先出清的部分。

人人都能成为机器人 " 训练师 "

集中采集模式难走通,行业开始向分布式要答案。Figure 公布的 Helix 2.5 实验证明了众包模式的价值:在 30 套陌生住宅中,不采数据、不额外训练,Index 的预训练让零样本成功率从 9% 提升至 56%。

觅蜂打造的众包模式同样如此,让数据生产从 " 专人专职的成本项 " 变成 " 顺路产出的增量项 "。宝妈做家务、餐厅服务员备餐、产线工人装配零件,动作本身就在日常生活中发生,采集只是额外增加一个记录环节,就能在原本 8 小时的工作时间里,产出 5 到 6 小时的有效数据,采集成本压缩到集中式采集的几分之一,甚至更低。

接单方式和外卖、网约车的众包逻辑异曲同工,平台方统一发布采集任务,大众通过觅蜂派 App 申领设备,在自身生活或工作场景中完成指定动作,数据经平台校验处理后交付客户,采集者按有效时长获取报酬。

《IT 时报》记者在觅蜂派 App 上观察到,平台目前覆盖了 22 大类场景、5000 多项任务,包括车间生产、商超理货、农业生产、医疗护理,甚至非遗技艺、体育运动等技能,也能成为训练机器人的数据来源。每次工作时长和报酬因内容不同有所区别,大致为 2 分钟到 90 分钟不等,价格从 6 元到 30 元不等。

其中最受欢迎的是居住类场景,包括物品收纳、家居清扫、厨房整理等。这类场景贴近普通人的日常生活,采集门槛极低,任务完成自由度高,大部分名额已经被抢空。

42 岁的网约车运营人员李国英是较早一批参与数据采集的众包用户。结束白天的跑车工作后,他回到家就会戴上平台提供的 MEgo 数采设备,记录浇花、擦玻璃、整理桌面和文件的过程。大约 15 分钟后,他将数据上传至觅蜂派 App,通过审核后获得任务收益。

众包模式的两道必答题

在数据如何被使用、最终服务于谁的问题上,Figure 的 Index 与觅蜂派的方向各不相同。Index 主要围绕 Figure 自身的模型训练需求建立数据闭环;觅蜂派则面向不同模型厂商、机器人企业和数据采购方,根据客户训练需求组织数据生产,将处理后的数据作为产品与服务对外交付。

能否跑通这套商业模式,觅蜂需要回答两个问题:一是谁会买数据、用数据?姚卯青将目标客群归纳为三类。第一类是具身智能企业,需要大批量的无本体众包数据用于基座预训练,帮模型建立通用的动作表征与环境感知能力;也需要对应本体的真机数据开展场景后训练,定向优化特定任务的成功率;第二类是世界模型创业公司,高度依赖第一视角的真实交互数据学习物理规律、动作逻辑与空间表征;第三类是头部大模型厂商。" 大模型企业要进一步提升模型本身的智能能力,必须要进入真实世界去闭环、去决策这些数据。" 姚卯青说。

据了解,觅蜂百万小时级无本体数据已开始服务腾讯 Robotics X 实验室、蚂蚁灵波等头部客户,根据不同模型训练需求提供相应的数据产品与服务。

另一个问题是,众包模式能够快速扩大产能,但分散在全国各地的采集者,如何保证数据输出质量?

觅蜂给出的方法是 " 硬件统一打底 + 自动化质检为主 + 分级价值复用 " 的全链路管控。所有众包人员使用 MEgo 系列采集设备,从硬件端就拉平采集标准;其次,端侧设备做基础合规校验,云端引擎自动完成画面切片、动作识别、隐私脱敏和质量打分,再辅以人工抽检。同时,按质量打上分级标签,匹配预训练、微调等不同阶段的模型需求。最终通过结算环节的数据,超过 95% 能进入模型训练环节。

从全球范围看,Figure 的 Index 平台、国内的觅蜂派等玩家,都在验证众包数采的可行性,但赛道远未到终局,数据确权、定价标准、安全合规等行业共性规则仍待建立,从百万小时到亿小时的规模跨越,还需要更多模式创新。

可以确定的是,具身智能的数据供给,已经告别 " 一拥而上建工厂 " 的野蛮生长阶段,正在走向分工更清晰、模式更多元的成熟期。

排版/ 季嘉颖

图片/ IT 时报   觅蜂

来源/《IT 时报》公众号 vittimes

E   N   D

大家都在看

IT 时报

怕被 AI 替代?

不如先学会用好它

「挨踢妹 @AI 茶水间」

每日投喂

扫码即可加入↓↓↓

请加「星标」不错过我们

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 北京首钢 普通人 杭州 轻量化
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论