四位一线操盘手揭示:最不缺钱的具身智能,到底缺什么样的数据?
2026 年的夏天,具身智能热得发烫:
钱多。 前 7 个月融资超 750 亿,超过 2025 年全年的 4 倍,约为 2024 年全年的 22 倍。(据 IT 桔子数据统计)
热度高。WAIC 刚收官,世界机器人大会又将开幕:300 家企业、2000 件展品。
甚至部分卖铲子的人,比淘金者更快拿到钱。25 家数据公司半年融资 170 亿。
一切都在增长。
但恰恰在这烈火烹油的当口,一个最基础、最关键的缺口浮出水面——有效关键数据。
"100 万小时 " 正在成为具身智能的新尺度。
但采集时长算的是 " 花了多少时间 ",训练产量算的是 " 有多少真能用 "。大多数数据在两者之间被丢掉了。
行业真正缺少的,不只是更多数据,而是一套能够回答 " 什么算有效经验 " 的共同口径:
能否提升能力、能否跨任务 / 场景 / 本体复用、是否值得长期投入和持有。
所以这一次,我们把模型公司、真实部署方与数据基础设施方拉进同一张桌子,只讨论一件事:
什么样的数据,是具身智能界最有价值的资产?
四位一线操盘手,一场数据的价值对账
他们分别站在世界模型与真实部署、预训练、数据评测、真实数据生产与基础设施四条链路上,四种视角放在一起,才能把 " 采什么、怎么练、如何验证、能否复用 " 连成完整闭环。
他代表世界模型与真实部署回流视角。
曾任职于腾讯计算机视觉研发中心,主导多模态视觉技术研究,在 CVPR、ICCV、NeurIPS 等顶级会议发表多篇论文并担任领域主席,持有国内外技术发明专利近百项。
如今他主导酷哇科技世界动作模型、VLA 与端到端自动驾驶的研发,直面真实场景中的失败、接管和纠偏——他知道,一条被认真标注过失败原因的轨迹,是否比一百条顺畅的重复动作更有价值。
他将回答:真实部署中的 " 翻车 " 数据,如何变成下一轮模型训练的高价值经验?
他代表预训练与数据配方视角。
博士毕业于中国科学技术大学,曾任微软亚洲研究院高级研究员,主导多个生成模型、世界模型和具身智能项目研发,入选人工智能华人新星百强榜单。
他主导研发的 Spirit v1.5、1.6 系列具身基础模型,每天都在回答一个核心问题:人类视频、真机示教、仿真生成和部署回流,各自教会了模型什么?当数据预算有限,规模和质量的取舍天平该往哪边倾斜?
他将揭示:预训练阶段,不同数据源的能力贡献如何量化,以及 " 数据配方 " 怎样决定模型的上限。
他代表数据、仿真、评测与产业生态视角。
北京大学物理系学士、巴黎矿大工程硕士,兼具 AI 视频生成创业经历与腾讯技术工程事业群、广告技术团队的产品和战略管理经验。
作为具身仿真评测产品负责人和新一代仿真引擎 Newton 技术指导委员会委员,他长期参与构建连接真实人类行为数据、物理测量、仿真生成、工业级评测与真实场景部署的物理 AI 基础设施。
他将带来:人类数据、物理测量与仿真数据如何形成闭环;评测如何连接模型训练与真实能力;以及数据、模型、机器人企业与产业场景如何通过生态协作,共同推动物理 AI 基础设施化与规模化落地。
他代表真实数据生产与数据基础设施视角。
四川大学软件工程学士、普渡大学计算机科学硕士,曾在美国从事自动驾驶与机器人研发,长期深耕 AI 与数据基础设施的工程落地。
他主导搭建了面向跨本体、跨传感器的数据回流与管理系统,让真实训练需求变成可生产、可评价、可理解、可筛选、可交付的多模态时空数据——他知道,数据不是采回来就够,能稳定进入训练流程的才叫 " 有效 "。
他将揭示:跨本体数据的治理与评价,如何让第三方生产的数据获得模型公司的信任?
真实数据如何跨越工程、质量与合规三道门槛,稳定进入海内外模型训练流程?
我们不问 " 数据够不够多 ",只追问三组真问题
如果只有 1 亿元数据预算,四条路线与数据处理应如何分配?
人类第一视角视频、真机遥操作、仿真生成和真实部署回流,分别适合学习语义、意图、动作先验、接触、受力、失败恢复还是安全边界?
一小时采集数据中,多少能真正进入训练集?被丢弃的数据为什么被丢弃?
数据成本应该按采集小时、有效轨迹、难例密度,还是模型能力增量计算?
本体变化后,过去的数据还剩多少价值?
甲方、机器人公司、模型公司和数据服务商共同产生的数据归谁?可复售的数据还能构成护城河吗?
具身模型、本体、数据采集、仿真、训练场与场景部署方向的创业者和技术人
机器人、AI 硬件、智能制造及相关产业上下游从业者
科技投资人、研究者、媒体人与行业观察者


登录后才可以发布评论哦
打开小程序可以发布评论哦