SHEN MOU
作者:郑施婧
原创:深眸财经(chutou0325)
当下,AI 行业最常被提及的焦虑,非算力短缺莫属。英伟达 GPU 一卡难求的新闻屡见不鲜,价格也随之高涨。以 H100 为例,市场价一度被炒至 4 万美元以上,是其官方定价两倍以上,同时交货周期拉长至数月。这种供需错配推高了 AI 企业的训练成本,也让市场弥漫着焦虑的情绪。
然而,当我们把视线从大模型移至具身智能,就会发现,算力荒在这里更像 " 成长的烦恼 "。更令从业者夜不能寐的,是另一个早已降临的深层瓶颈 " 数据荒 "。
据行业测算,要训练出具备通用泛化能力的具身模型,需要千万,甚至亿小时级别的真实操作数据;而截至 2026 年初,全球可用的高质量物理交互数据总量仅约 50 万小时,缺口超过 99%。这意味着,具身智能当前的数据基础,距离真正意义上的通用泛化能力还差两个数量级以上的距离。这不是渐进式的差距,而是根本性的断档。
具身智能已经撞上了一堵比算力短缺更难翻越的"数据荒漠 "。
01
" 算力荒 " 是工程问题
" 数据荒 " 是维度灾难
过去,摩尔定律让单芯片晶体管数量每 18 个月就能翻一番。算力成本持续下降,英伟达 H100 的 FP8 算力接近 2petaFLOPS,相较五年前的 V100,单位算力成本大幅下降;台积电 CoWoS 封装产能也在有序扩产,月产能从 2023 年的约 1.4 万片晶圆,在 2025 年提升至约 7 万片,预计 2026 年底增加到 13 万片。
如此来看,算力瓶颈是产能问题,有明确的扩产周期。但具身智能面对的是物理世界的无限复杂性,这更像是一场维度灾难。
首先就是数据无法被 " 爬取 "。大语言模型可以吞噬互联网上人类千年积累的文本资料,例如 GPT-3 就有约 45TB 数据。但机器人要理解物理世界,却没有现成的 " 教科书 "。
单论 " 拧瓶盖 " 这个人类凭直觉完成的日常动作,背后是物理世界的无数隐藏变量,机器人需要理解瓶盖的材质、螺纹摩擦力等多变量。而这些变量恰恰是互联网这个 " 大模型粮仓 " 从未储存过的。
所以当大模型用"文字"丈量世界时,具身智能需要用"动作 " 来感知物理现实。这种性质上的差异,让数据荒漠远比算力竞赛更为棘手。
另外,具身智能对数据 " 质量 " 的要求也远比大模型严苛。在大模型训练中,错别字或语法瑕疵尚能处理。比如说,GPT-3 的训练数据里可能混入了像 " 偶今天真滴好开森 " 这种口语化、带错词甚至缺标点的句子,但大模型依然可以从大量规范文本中提炼出主谓宾的规律,学会正常的表达方式。
而具身智能的数据规律就远不如文字清晰,噪声的类型、严重程度、对模型的影响都难以定义。例如,采集时摄像头帧率抖动、关节编码器延迟、力控传感器漂移等,这些噪声不像文本错别字那样可以检索替换。
鹿明机器人联席 CTO 丁琰就曾指出,市面上大量 UMI 数据采集设备因硬件能力不足,画面与动作无法严格对齐,导致产出的数据根本 " 不具备进入训练管线的条件 "。这意味着,具身智能的数据采集从一开始就面临 " 质量门槛 ",低质数据不仅无法助力训练,反而会污染模型。后者是 " 费力 ",前者则可能是 " 无用 "。
除此之外,具身智能的数据还无法像算力一样迁移复用。例如,英伟达的 GPU 架构从 A100 到 H100,能针对不同任务的计算效率持续提升,模型训练可以无缝升级。但具身智能具有极强的硬件依赖性,一台 1.6 米高的机器人与 1.8 米高的机器人,在执行同样的 " 弯腰捡拾 " 动作时,关节角度、重心偏移、抓握角度等可能完全不同。所以前者采集的数据,对后者而言可能无效。这也导致具身智能数据之间有天然的隔离,形成了一个个独立的 " 数据孤岛 "。
如此来看,算力是可复用的标准化资源,随着工艺进步和产能扩张,其成本与获取难度必然趋近于下降;而数据却是与特定硬件、特定场景深度绑定的 " 非标品 ",每一款机器人、每一次部署都可能需要重新积累。从本质差异上来看,算力荒是暂时的、可解的,而数据荒是长期的、结构性的核心瓶颈。
02
真机、UMI、仿真三路并进
数据采集路线尚在突围
面对 " 数据荒 " 的困境,目前业界主要探索出三条技术路线,即真机遥操作、无本体 UMI 采集、仿真合成数据。它们分别代表了精度、规模与成本的权衡,但尚未有一条能完美兼顾三者。
先来看真机遥操作。这是最早的方案,通过 VR 设备、动捕服等遥操作真实机器人,逐条记录动作数据。优点是数据真实度高、可直接用于同款机器人训练。例如,宇树科技的基于轮式人形机器人 G1-D 的数采训练全栈解决方案,其采集数据可直接用于同款 G1-D 机器人的模型训练。
但代价同样惊人。北京人形机器人创新中心投资建设了近 5000 平方米的数采场地,投入了 120 台机器人用于数据采集,仅场地和设备投入就达数千万元。智元机器人建有大规模数采中心,部署约 200 台机器人,数百名数据采集员的轮班运营。场地、设备折旧加上人力薪酬,构成了长期且高昂的固定支出。
(图源:智元机器人)
目前来看,真机遥操作好比手工精雕,精度虽高,但速度慢、花费大。这种模式或许更适合在高附加值场景,如医疗手术、特种作业中担任主力数据源。如果要靠它撑起亿级数据的底座,以目前机器人厂商的资金储备来看,或许难以承担。
UMI 方案则将采集设备与机器人本体解耦,用人手持轻量化的夹爪和摄像头,在真实场景中操作采集。大衍科技就曾通过与无人超市、前置仓合作,让工作人员佩戴采集设备正常上班,在日常生活中就把数据采集了。如此,UMI 更像用上了半自动工具,虽然仍需人力,但采集速度快了不少,花费也大幅下降。
然而,上海交大卢策吾团队却指出,具身模型规模化卡在数据采集的 " 真实性与质量平衡 " 难题。具体而言,UMI 采用手持设备,难以保证每次采集时摄像头角度、夹爪姿态的一致性,导致数据格式不统一;大规模采集后,海量低质量数据需要大量人工后处理进行筛选和对齐,反而可能使综合成本不降反升。如此来看,UMI 虽然降低了采集门槛,却把数据质量的 " 雷 " 埋在了更隐蔽处。
而仿真合成这条路则彻底抛弃真机,直接在仿真引擎中生成海量训练数据。例如,跨维智能开源的工具链 EmbodiChain,100% 使用合成数据训练 VLA 模型,且能直接部署于真实机器人,实现了虚实迁移;诺基亚联合英伟达,基于 Isaac 仿真平台构建 "AI 数据飞轮 ",将智能体训练速度提升近 10 倍。
但问题在于仿真毕竟是 " 仿 " 的。仿真环境再精细,也无法完全复现现实生活。斯坦福大学《2026 AI Index Report》显示,仿真环境下任务完成率可达 89.4%,但在真实家庭场景中骤降至约 12.4%。这揭示了一个残酷的现实,仿真训练出的模型在实验室里是 " 优等生 ",可一旦踏入真实世界的 " 考场 ",成绩便大打折扣。虚实鸿沟仍是仿真路线上绕不开的硬门槛。
(图源:斯坦福大学《2026 AI Index Report》)
三条路线各有优劣,短期内将在不同场景中并行探索,真机遥操作守住精度上限,UMI 主攻规模化采集,仿真合成负责覆盖极端场景。长期看,UMI 兼顾真实性与可低成本扩充规模,或许是突破数据荒的主力。
03
陷入 " 囚徒困境 " 的数据采集
与不明朗的行业最优解
无论哪条路线,似乎都卡在同一个死结上,数据无法同时满足 " 规模、质量、成本 " 三角。每家公司都在投入,却都走不远。面对如此困境,从全行业理性角度出发,或许最优解是将数据开源,即共享数据、摊薄成本、避免重复采集。
市场上已经有了先行者。乐聚牵头联合宇树、阿里云等共建国内首个国家级具身智能开源数据社区 OpenLET,已开源超 6 万分钟真机数据集,供业界使用;均普智能于 2026 年 6 月开源了面向真实机器人强化学习的大规模数据集 RW-RL-Dataset。这些尝试为行业提供了宝贵参照,也在证明数据共享在技术层面并非不可行。
然而,开源仍是少数派的理想主义,更多企业选择了商业变现之路。京东将数据采集作为独立生意,计划发动最多 60 万人参与,两年内积累 1000 万小时视频数据,并已上线具身智能数据交易平台,首批定向开放 2000 小时高精标注 " 数据集 ";箸境智能在江苏省数据交易所完成全国首笔具身智能数据集交易,包含约 2.5 万条结构化数据,覆盖办公、商超、餐饮、家政四大场景;鹿明机器人则打造了 " 数据超市 ",供客户在线采购标准化操作数据。星海图 CEO 高继扬就曾明确指出,当前行业对于数据具有强烈的 " 私有化属性 "。由此看来,数据在当下更被视为企业的核心资产和可交易的商品,而非开源的公共资源。
(图源:LUMOS 鹿明)
数据共享虽然能让全行业受益,但商业逻辑下,谁先开源,谁就可能被对手低成本复制成果。于是这家不愿为别人作嫁衣,那家担心对手反超。个体都保护自身利益,最终导致全行业重复采集、效率低下。这正是经典的"囚徒困境"。共享是乌托邦式的理想,现实却正滑向"各自为战"。目前来看,除非出现强有力的行业标准与利益分配机制,否则行业"最优解"可能将长期停留在愿景中。
04
从 " 数据喂养 " 到 " 自我迭代 "
数据 " 奇点 " 何时到来?
如果行业注定要各自突围,那最有可能的方向是什么?或许我们可以从大模型的进化中寻找启示,比如让机器从 " 被投喂 " 走向 " 自主觅食 "。
大模型的发展已验证这条路径。英伟达研究团队开发的 Eureka 系统,让 AI 能生成多个解决方案并自我筛选,像程序员一样进行 " 自我批评 " 和改进。Eureka 在 83% 的任务中超越人类专家,使机器人性能平均提升 52%;Kimi K2 则通过构建工具模拟器让智能体在 " 沙盒 " 中练习,在与模拟环境的持续交互中积累经验并自我迭代。
这两个案例的共同逻辑是,智能体不再被动等待人类投喂数据,而是通过与环境互动自主生成训练信号。或许可以借鉴这一逻辑,通过某种机制实现具身智能的自我迭代。
具身智能的" 数据奇点",可能不在于数据量的堆砌,而在于形成一个"采集→训练→落地→再采集 " 的闭环。
上海创智学院与智元具身研究中心联合提出的 LWD 系统,正是这一理念的实践。它让机器人在真实任务中持续积累交互经验,包括成功轨迹、试错后的自我恢复,以及人为引导的失败案例,全部回传,持续微调优化模型。通过这一机制,LWD 训练的单一通用策略在长程复杂任务中的平均成功率达到 0.95,远超传统行为克隆的 0.76 和离线强化学习基线的 0.86。
这一结果表明,闭环迭代并非纸上谈兵,而是已被验证的有效路径。循此思路,可以设想一个场景:机器人学会 " 扭瓶盖 " 后,应用时遇到一个滑丝瓶盖,经微调扭矩后成功拧开。这个 " 意外经验 " 被记录下来并回传,模型更新后再部署给所有机器人。此后,所有机器人都学会了处理滑丝瓶盖。扩展后,每个机器人遇到的特殊状况,都可以变成整个机器人群的共同经验。当跑通这个闭环,或许机器人将不再依赖人类的持续投喂,而是在真实世界的场景中自主进化。
总而言之,对于具身智能来说,算力可以购买,但物理世界的经验必须亲身积累。谁能率先让机器人在真实世界中跑通 " 自我迭代 " 的飞轮,谁就将更可能定义下一阶段的行业格局。这场漫长的马拉松,或许比的不是谁拥有更多 GPU,而是谁能让机器人更好地 " 理解 " 这个物理世界。
* 图片来源于网络,侵权请联系删除


登录后才可以发布评论哦
打开小程序可以发布评论哦