最值得的关注是,光轮智能作为唯一一家中国公司,出现在这个顶级大佬云集的全球标准牌桌上。
EgoVerse:Danfei 想做的不只是一个数据集
机器人学习长期面临一个明显的数据悖论。
目前机器人训练仍然依赖真机遥操作,每增加一条演示,都需要机器人硬件、操作人员、实验场地和复位流程。采集速度慢、成本高,能够覆盖的任务和场景也很有限。
而人类的各种行为天然包含丰富的视觉信息、动作过程、物体交互和任务策略,明显是机器人更好的老师。
第一视角人类数据提供了新的路线:先记录人如何在真实环境中完成任务,再把这些经验迁移给不同机器人。
但过去的人类数据集大多是一次性项目。
不同团队使用各自的采集设备、坐标体系、动作标签和任务定义,数据发布后也很难持续扩张。即使两家机构都采集了 " 把杯子放到碟子上 ",两份数据也未必能够直接放在一起训练。
Danfei 及其合作者因此没有把 EgoVerse 设计成又一份静态数据集,而是做成了一套 " 活 " 的协作框架。
EgoVerse 当前公开版本包含 1362 小时人类演示数据、约 8 万个 episode、1965 项任务、240 个场景和 2087 名采集者。数据不仅包含第一视角视频,还提供相机位姿、三维手部信息以及细粒度语言描述,并在不同实验室、不同任务和不同机器人本体上验证人类数据的迁移效果。
一套事实标准形成之前,往往要先完成几件事:
让参与者采用共同的数据结构,遵守共同的任务语义,生产可以相互兼容的数据,并用统一方法检验这些数据是否真的有效。
EgoVerse 正在做的,正是这一步:先让全球具身数据开始按照同一套 " 语言体系 " 流动。
EgoVerse 的核心共建方,都是什么背景?
具身人类数据并不是戴上一副眼镜、录一段视频,再加几个标签那么简单。完整采集流程至少包括研究问题定义、采集硬件、动作迁移、规模化运营、数据标注和机器人验证。任何一家机构,都很难单独完成所有环节。
EgoVerse 召集了具身领域里最头部的高校、学者、机构进行全球协作,共同定义具有划时代意义的数据标准。
佐治亚理工 Danfei Xu 教授:具身人类数据采集路线标志性代表,EgoVerse 的发起人
佐治亚理工承担的是 EgoVerse 的组织中枢和研究框架角色。Danfei Xu 与 RL2 团队长期关注机器人如何从人类数据中学习。到了 EgoVerse,问题不再只是 " 某一批人类视频能不能改善某一台机器人 ",而是进一步升级为:人类数据的效果能否跨实验室复现?能否跨机器人本体成立?数据规模增加时,能力是否稳定增长?哪些类型的数据才真正具有迁移价值?
EgoVerse 让不同实验室在共享协议下重复实验。佐治亚理工学院负责的代表任务是 object-in-container,斯坦福大学负责双臂精细操作,UC San Diego 和 ETH Zurich 则参与长时序双臂任务验证。由此,Danfei 搭起一种新的协作方式,使过去互不兼容的数据、算法、机器人和实验室,开始在共享协议下回答同一组问题。
斯坦福 Shuran Song 教授:UMI 发明人,让人类操作经验能够迁移给机器人
人类有柔软灵活的双手,机器人可能只有两指夹爪;人可以依靠触觉、经验和身体协调完成任务,机器人却需要明确的观测和动作表示。因此,人类数据并不会天然变成机器人能力,中间横着一道 " 具身鸿沟 "。
Shuran Song 带领的斯坦福 REAL Lab,是打通这条路径的代表团队之一。 其团队开创的 UMI —— Universal Manipulation Interface,使用便携式手持夹爪采集真实环境中的人类操作,再将这些演示转化为可部署的机器人策略。
UMI 的关键价值,是让数据采集摆脱固定机器人和实验室。人可以带着设备进入真实环境进行复杂长时序任务,学习得到的策略还能迁移到不同机器人平台。
简单说,斯坦福要解决的是:让人类经验变成机器人能执行的动作。
Meta:为 EgoVerse 提供专用数据采集眼镜
第一视角数据采集首先需要一双合格的 " 眼睛 "。Meta 研发的 Project Aria,是 行业首个专为 " 大规模基础模型 " 设计的专用数据采集硬件,可以记录第一视角视频、手部动作、相机位姿和空间信息。设备包含面向前方的 RGB 相机,以及用于 SLAM 和手部追踪的同步场景相机。没有这类空间感知能力,第一视角数据很容易只是一段 " 看起来像人在干活 " 的视频。Meta 解决的是如何把 " 人看到了什么 ",升级为 " 人在三维世界中如何行动 "。
Mecka:人类数据先驱,把数据采集从专用眼镜普及到手机
如果一套人类数据生态只能依赖少数专用硬件,它能够覆盖的采集者与真实环境就始终有限。
Mecka AI 推动了一条更便携的采集路线:使用 iPhone 与轻量化头戴装置完成第一视角采集,再通过云端处理恢复头部轨迹与双手三维关键点。
这一方案让第一视角数据不再只来自少数机器人实验室,而能够进入家庭、商店、工作场所和更多真实任务环境。
Mecka AI 所解决的,是如何让人类数据采集从专用设备走向更低门槛、更广覆盖的生产方式。
Scale AI:人类数据的规模化制造工厂
数据采回来之后,还要经历清洗、标注、质检、结构化和版本管理。
Scale AI 从 2016 年起长期从事 AI 数据基础设施建设,最早以自动驾驶等场景中的大规模数据处理能力闻名。进入 Physical AI 阶段后,它又把数据工厂数据扩展到机器人数据采集、标注、人工反馈和模型验证。
Scale 更擅长把数据生产变成一套成熟的运营和处理系统,从而在人类演示从几百条变成几万小时后,把大规模、异构的原始采集结果,转化为稳定可用的数据产品。
光轮智能:在规模化的前提下,构建人类数据最高质量标准
当具身数据生产真正迈向千万级小时,单单依靠采集工具和后处理,无法满足规模化下的数据质量需求。同时,采集设备越多、采集人员越多、场景越复杂的趋势下,视角偏移、动作遗漏、任务中断、设备异常和标注不一致等问题也会被同步放大。
数据可以快速增长,但真正能被机器人学习的有效信息,并不一定同步增长。
而光轮智能补上的,是一套贯穿端侧采集、云端处理和仿真验证的质量控制体系。
与绑定某一款眼镜或采集设备的方案不同, 光轮智能的目标是让数据管线兼容不同硬件。无论原始数据来自 Aria、iPhone、头戴相机还是其他多模态设备,都可以进入统一的云端管线,通过 VIO、三维手部与 Body 标注、V7 级动作语义标注,被转化成同一质量标准下的训练资产。
数据完成处理之后,光轮智能还会利用物理仿真 SimFoundry 和模型评测能力 RoboFinals,进一步验证动作轨迹、物理关系和任务过程能否被合理还原,并判断数据是否真正具有机器人学习价值。通过不断的回环评价,掌握最快速的质量反馈,并且不断迭代,引领标准。
因此,光轮在 EgoVerse 中的贡献,是让数据在规模化生产中依然做到源头可控、跨硬件统一、价值可验证。
此外, MicroAGI也在探索分布式众包采集,通过让操作人员在真实家庭环境中自然完成任务,将人类数据生产从实验项目转化为可持续运营的采集网络。
规模化之后,光轮智能如何定义高质量人类数据
传统数据质量控制,通常关注文件是否完整、格式是否正确、轨迹是否缺失,以及标注是否通过。
但这些指标最多只能证明一条数据在生产流程上 " 合格 ",不能证明它真的值得机器人学习。
一段视频可能拍摄完整,动作轨迹却无法被机器人执行;一条标注可能符合规范,其中的任务过程却缺少关键步骤;一批数据看起来数量庞大,实际覆盖的人群、场景与动作分布却高度重复。
光轮智能将人类数据质量拆成三个连续环节。
首先,用 Agent 驱动数据采集质量与数据分布。
在光轮智能看来,具身数据最大的质量风险,经常发生在采集现场。
关键动作是否进入画面?手与物体的交互是否被遮挡?任务起点和终点是否完整?采集者是否偏离操作要求?一个 episode 虽然录制完成,是否真正包含完整的学习过程?
如果这些问题等到数据上传后才被发现,往往只能整段作废,或者重新组织人员补采。
光轮智能的 Agent 驱动采集体系,会围绕设备状态、任务流程、动作完整性和有效视角进行实时检查,并在发现风险时推动现场纠偏或补采。
更重要的是,Agent 不仅负责单条数据质检,也可以根据已有数据分布,调控下一轮需要采集的人群、场景、任务与动作类型,避免数据规模增长后出现大量重复样本。
这使数据质量从事后抽检,转化为生产过程控制。
其次,通过兼容多种采集硬件的云端平台,实现统一的数据标准。
无论原始数据来自眼镜、手机、头戴相机还是其他多模态设备,都需要经过云端统一的处理和质量控制,才能进入同一个训练体系。
光轮的处理流程包括视觉惯性里程计,也就是 VIO,用于恢复相机在空间中的运动;三维手部与 Body 标注,用于还原人的身体动作和手物交互;以及 V7 级动作标注,把一段连续视频进一步切分为可以与任务过程对齐的动作语义。
光轮智能的人类数据解决方案 EgoSuite,能够在生产规模上提供三维手部、三维全身姿态和帧级语义标注,并强调在遮挡和近距离物体交互情况下维持稳定追踪。其平台也公开强调对不同商业设备、研究型眼镜、动作相机和定制采集系统的兼容能力。
这套思路可以用一句话概括: 硬件可以多元,进入模型之前的数据标准必须一致。
最后,用仿真与评测检验数据价值。
数据处理完成后,还要回答一个更关键的问题: 这些数据,是否真的值得机器人学习?
光轮智能将自研仿真平台 SimFoundry与工业级评测平台 RoboFinals接入人类数据质量闭环。 SimFoundry将人类数据中的动作轨迹、物体关系和任务流程,转化为机器人可执行、可复现的仿真任务; RoboFinals则通过标准化评测,验证这些数据究竟提升了哪些任务,又会在哪些机器人本体、场景和物理条件下失效。
因此,数据价值不再由生产方自行定义,而是由机器人训练和评测结果共同验证。评测过程中发现的失败案例,也会进一步反馈给采集端,指导下一轮需要补充哪些数据、扩大哪些分布、修正哪些采集规则,形成持续优化的数据闭环。
最终,高质量具身人类数据形成一条完整的数据质量闭环:
端侧 Agent 实时控制采集质量 → 多种采集硬件统一接入云端 → VIO、手部、Body Pose 与动作语义标准化处理 → SimFoundry 将人类数据转化为机器人可执行任务 → RoboFinals 验证数据学习价值并定位失败模式 → 评测结果反馈下一轮数据采集。
唯一中国公司,进入全球两大具身基础设施标准
随着具身智能从单点技术验证走向规模化发展,行业竞争正在从模型能力,进一步延伸到底层基础设施与标准体系。
其中,两条关键主线正在形成。
一条是以 EgoVerse为代表的数据基础设施,定义高质量具身人类数据如何采集、组织、处理、共享和持续迭代;另一条是以 Newton为代表的物理仿真基础设施,定义机器人如何在遵循真实物理规律的仿真世界中完成训练、验证和评测。
Newton 由 NVIDIA、Google DeepMind 和 Disney Research 联合发起,由 NVIDIA、Google DeepMind、Disney Research、光轮智能和 Toyota Research Institute(TRI)五家企业共同组成技术指导委员会(TSC),持续定义机器人仿真与物理建模的技术路线,正逐渐成为全球具身智能的重要物理仿真基础设施。
前者解决机器人从哪里获得可规模化的学习经验,后者解决这些经验如何在物理世界中被复现和验证。数据与仿真,共同构成物理 AI 走向规模化的两大底座。
光轮智能成为目前唯一同时参与这两套国际标准体系的中国企业。
在 EgoVerse 中,光轮带入的是一套贯穿人类数据生产全流程的质量体系:从端侧 Agent 管理采集过程,到多种硬件数据进入统一云端管线,再到通过仿真与模型评测验证数据价值。人类数据质量由此从依赖人工抽检和经验判断,走向可定义、可比较、可验证、可持续优化的工程标准。
在 Newton 中,光轮参与物理求解、仿真资产、机器人训练与评测等核心能力建设,推动真实世界中的物体、任务和物理过程,转化为机器人可以交互、训练和验证的仿真基础设施。
这意味着,光轮参与定义的不只是某一种数据格式,也不只是某一套仿真工具,而是连接真实世界数据、物理仿真、模型训练与能力验证的底层标准。
如果说 ImageNet 为视觉 AI 建立了共同的数据基础设施,那么 EgoVerse 与 Newton 则分别从数据和仿真两个方向,为物理 AI 建立新的全球基础设施。
光轮同时进入 EgoVerse 与 Newton,参与建设的已经不只是今天的工具链,而是未来全球具身智能产业共同遵循的底层基础设施。这也意味着,中国企业开始从标准的使用者,走向全球物理 AI 基础设施规则的共同定义者。


登录后才可以发布评论哦
打开小程序可以发布评论哦