有新Newin 9小时前
2026上半年:机器人还没落地,数据采集先赚到钱了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

印度班加罗尔,一位家政人员上门服务,她微笑询问屋主:" 我可以在头上戴一个小型摄像头,记录保洁全过程吗?这样您可以放心确认家里打扫到位,而且没有物品失窃或损坏。"

屋主欣然同意了这个古怪的请求。但她没有意识到的是,这份视频除了用于服务监督,还会在脱敏后出售给一家美国 AI 公司,成为家庭机器人的训练数据!

这个故事的关注点在于,具身智能的数据采集已经走出实验室,渗透到日常生产生活中。这是因为具身智能行业正在面临严重的数据短缺。

跟大模型训练不同,机器人训练需要多模态、高保真的物理交互数据,这类数据并不直接存在于互联网上。根据行业报告,截至 2026 年初,可供机器人训练的数据总量仅有约 50 万小时,缺口巨大。

2026 年,具身智能进入 " 数据瓶颈期 ",数据采集成为热门生意

过去半年,具身智能是 AI 领域最热门的方向之一。人形机器人发布会不断,VLA(视觉 - 语言 - 动作模型)、世界模型、具身基座模型频繁出现。但热闹背后,行业越来越清楚地意识到,当大语言模型用万亿参数涌现一代又一代更强大的模型,机器人领域却正在被数据荒漠所困。

于是在 2026 上半年,数据采集开始从机器人研发的幕后走向前台,变成可以被单独交易的产品和服务。资本也开始给这类数据平台单独定价:

2 月,智元孵化成立觅蜂科技,定位是一站式物理 AI 数据服务平台,6 月完成数亿元的天使 + 轮融资;

3 月,光轮智能完成 10 亿元融资,成为全球第一个具身数据独角兽,并透露第一季度拿下 5.5 亿元订单;

4 月,无问智科完成超亿元融资,并透露第一季度签下的订单金额达到数亿元量级;弈人科技完成连续两轮亿元级融资,同时宣布 2025 年收入破亿并盈利 ...

行业热度陡增,正如觅蜂科技董事长兼 CEO 姚卯青所说," 在具身智能尚未真正大规模商业化之前,数据作为基础设施,会比终端应用更早形成商业回报 "。

但融资热的背后,行业正分化出两种截然不同的公司:一种卖 " 单次的数据 ",另一种卖 " 持续生产数据的能力 "。前者赚的是项目收入,后者积累的是数据资产。这个差别,决定了谁只是赶上一波热度,谁能真正留在牌桌上。

数据从哪里来?四条采集路线,构成金字塔结构

如果说大模型的训练数据主要来自互联网,那么机器人需要的数据则需要在真实物理世界中 " 采集 " 出来。目前常见的采集路线,大致可以构成一个四层的金字塔结构。越往上,数据质量越高,成本也越高;越往下,数据越容易规模化,但要证明它能被机器人真正用起来。

第一层:真机遥操。真人使用遥操设备,隔空操控机器人完成真实任务,机器人实时录制操作过程。这层数据处于金字塔顶端,数据质量极高:有真实的物理接触、真实的不确定性、真实的失败。

但它的成本也最高,包括场地、机器人、遥操员、数据标准、监督管理等众多成本。行业公开资料显示,目前大型数据工厂的年产能达到百万小时量级。这个数据量级能在单一特定操作领域起到很好的训练效果。

第二层:无本体采集 & 动作捕捉。不占用机器人本体,而是用头戴设备、手套、夹爪、光学动捕等工具,记录人类动作轨迹,再把这些动作映射到机器人上。成本低于真机遥操,也更适合采集复杂动作(如:手部操作、舞蹈、武术)。但劣势在于存在 Embodiment Gap,人类操作时,会实时根据触觉反馈调整力度和姿态,机器人即使复制了人的动作轨迹,也未必能完成同样的任务。

第三层:第一视角视频。文章开头的案例就是这一类,用头戴摄像头记录人类在真实环境中的操作过程。比如保洁员如何擦桌子、厨师如何备菜、仓库员工如何分拣货物。优势在于,更接近人做事时真正看到的世界。但短板也很明显,视频本身不包含触觉、力度、精确轨迹等信息,需要进一步标注和补充传感器数据。

第四层:仿真合成。在虚拟环境中搭建场景,让机器人在模拟世界里反复训练、试错。仿真数据的优势是成本低、可复制、可规模化,英伟达 Isaac Lab 可以在单台 GPU 上运行成千上万个虚拟机器人同时训练。

仿真合成尤其适合危险、稀有的场景,比如让机器人反复摔倒、打翻杯子、撞到障碍,而不造成真实损失。其劣势在于,仿真世界和真实世界之间始终存在差距(Sim-to-real Gap)。模型在虚拟环境里学会的动作,能不能迁移到真实场景,仍然需要验证。

所以,具身数据采集不是押注单条路线,而是多条路线共同补位:真机遥操解决 " 准不准 ",无本体和动捕解决 " 能不能降成本 ",第一视角视频解决 " 能不能进真实场景 ",仿真合成解决 " 能不能补长尾 "。四条路线不是互相替代,而是在数据质量、成本和规模之间做不同取舍。

行业真正的竞争,发生在如何用更低成本的路线,逼近真机遥操的数据质量。谁能在这个取舍里找到最优解,谁就掌握了规模化的入口。

同样是数采公司,它们卖的东西并不一样

四条路线解释了 " 数据怎么来 ",但对数采公司来说,更关键的问题是这些数据怎么变现。头部玩家往往不会只押注单一路线,而是把采集硬件、数据服务、数据平台、训练中心等能力打包在一起,形成自己的收入结构。下面这张表选取了部分代表性玩家,看看它们是怎么做 " 数据采集 " 这门生意的。

数采公司的竞争,不是简单比谁采的数据多,而在于谁能把一次性交付,沉淀成可复用的数据资产和长期服务。有的公司卖入口。包括头戴相机、触觉手套、夹爪、动捕系统等,都是把真实世界变成训练数据的入口。这类硬件或工具链生意,标准化程度相对高,更容易起量,但存在天花板。

有的公司卖交付。客户提出任务和场景,数采公司组织人员、设备和流程,交付一批清洗、标注、质检后的数据。这是早期最容易形成收入的方式。但它的问题是,每一单都是定制项目。项目越多,收入越高,但组织复杂度也会同步上升。

更有想象力的是卖数据集。如果一家公司拥有合规授权和自有版权,就有机会把同一批高质量数据授权给多个客户,或者持续卖给不同模型团队。和项目制相比,数据资产的边际成本更低,也更接近 " 产品 "。但这条路门槛更高:数据来源要合规,授权链条要清楚,格式要标准,质量要稳定,还要证明它真的能提升模型效果。

再往后,是卖平台和基础设施。平台卖的是一整套数据闭环:采集、上传、清洗、标注、质检、评测、训练回流。训练中心和数据工厂卖的则是持续生产数据的能力,包括场地、机器人、工位、任务库和运营流程。它们不只是交付一批数据,而是试图嵌入客户长期训练体系。

数采行业真正的分化,不是简单看技术路线和产能,更关键是看这家公司卖单点设备,还是数据闭环;卖一次性项目,还是可复用资产;赚的是短期订单,还是能进入客户训练流程的长期收入。上半年数采行业完成的是 " 需求显性化 ",接下来要验证的是,谁能把采集能力真正变成可复用、可复购、可验证的商业闭环。

买方买的不是小时数,而是确定性

对买方来说,他们真正愿意付费的并不是 " 小时数 " 本身,而是这批数据能不能让模型变强的确定性。大语言模型可以通过数据规模直接放大能力。但机器人数据不一样,如果只是人在厨房里走来走去,却没有动作轨迹、任务目标、接触信息和失败反馈,对机器人训练的价值可能非常有限。

不同买方想要的 " 确定性 " 并不一样。大厂和通用模型团队,关心的是模型能不能继续扩规模;机器人本体厂,关心的是数据能不能转化为任务成功率;场景方,关心的是真实业务流程能不能沉淀为数据资产;地方平台,关心的是数据生产能力能不能变成产业基础设施。

第一类买方,是大厂和通用模型团队。阿里通义、字节 Seed、蚂蚁数科、英伟达 EgoScale 等团队,需要的是大规模、多样化的数据。它们关心的不只是某一个具体任务能不能做成,而是数据能不能支撑具身模型继续扩大规模。

第二类买方,是机器人本体厂。本体厂更关心落地。它们买数据,是为了让机器人在具体场景里表现更稳定:抓取成功率能不能提高,失败后能不能恢复,换一个物体、换一个房间、换一个工位,机器人还能不能完成任务。

第三类买方,是场景方。物流、零售、工厂、家政、康养等行业,本身就有大量真实业务流程。它们既可能购买机器人和数据服务,也可能反过来成为数据供给方,把日常业务过程变成可授权、可复用的数据资产。

京东这类公司值得关注,正是因为它们不仅有模型和技术团队,更有真实场景。仓库分拣、零售补货、家政服务、配送履约,这些任务每天都在发生。如果能够被合规采集、脱敏、清洗和回流,就可能成为机器人持续学习的燃料。

第四类买方,是地方政府和产业平台。训练中心、开源社区、数据交易平台背后,往往是地方产业竞争。它们买的不是某一批数据,而是数据生产能力和产业聚集能力:能不能吸引机器人公司来训练,能不能形成标准数据集,能不能支撑本地具身智能产业链。

因此,数采行业下半年的关键,不只是供给侧谁能采更多数据,也要看需求侧谁愿意持续买单。只有当大厂愿意复购、本体厂看到成功率提升、场景方愿意开放真实业务流程、地方平台跑出有效产能,数据采集才算真正从热门概念走向商业闭环。

下半年看什么?从供给成型到商业闭环

2026 上半年,具身数据采集完成的是从幕后走到台前。大量融资、订单、训练中心和数据平台出现,说明行业需求已经被看见。但需求显性化,不等于商业闭环已经跑通。下半年,还有很多问题亟待解决。

大厂预算会持续外采,还是转向自建?大厂和通用模型团队是数采行业最重要的需求方之一。它们往往先通过外部供应商做小批量验证,但当数据标准、采集方式和训练收益逐渐清晰后,也可能把能力收回内部。如果大厂快速自建,独立数采公司的空间就会被压缩。

数据商能不能出现复购和复卖?定制化项目更容易赚到钱,但每一单都要重新定义场景、任务、格式和验收标准。收入越高,交付压力也越大。如果同一批数据能被多次授权、卖给多个客户,说明公司开始从项目交付走向数据资产。这会直接影响数采公司的毛利结构和估值逻辑。

数据标准会不会开始收敛?具身数据最大的问题之一,是机器人构型不同、任务不同、传感器不同,导致数据格式很容易碎片化。一个客户能用的数据,另一个客户未必能用;一个本体采的数据,换一个本体可能就要重新对齐。如果行业开始出现更统一的数据格式、标注规范、评测基准和质量标准,数据才有机会从定制项目变成可流通资产。

真实场景数据会不会资产化?文章开头的保洁员案例,以及京东这类场景方的入局,都指向同一个趋势:未来最稀缺的数据,可能不是实验室里的标准动作,而是每天都在真实业务中发生的劳动过程。物流、家政、零售、工业、康养等场景,谁能把日常业务流程合规地采集、脱敏、授权、清洗和回流,谁就可能掌握下一阶段的数据入口。

所以,2026 上半年数采行业的关键词是 " 被看见 ";下半年的关键词会是 " 被验证 "。

机器人还没有真正大规模落地,但数据采集已经先一步被重新定价。这不只是一次商业机会的提前释放,更是一场关于数据资产归属权的抢位战。谁先把采集能力变成可复用的资产、嵌入客户的训练流程,谁就在机器人真正落地之前,锁定了这个行业最关键的入口。

精选内容

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 ai 融资 物理 美国
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论