智猩猩 2小时前
人类第一视角视频批量变为机器人数据!阿里Qwen交出18561小时Pipeline
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智猩猩 AI 整理

编辑:金水

机器人数据贵又少,人类视频能破局吗?

VLA 模型在机械臂上进步很快,但泛化能力始终卡在数据规模和多样性上。机器人演示数据贵、采集慢,即便有 Open X-Embodiment 等大库,规模仍远不及互联网视频。

人类第一视角操作视频成本低,但场景、物体、任务变化很多。主要困难在于人手和机械臂结构不同,直接训练行不通。

Phantom、Egomimic 等工作已在小数据、单任务上证明:把手部动作重定向并替换成渲染机械臂可行。

但还没人系统验证这种合成数据能否作为大规模预训练,提升 VLA 的分布外泛化能力。

这条路如果打通,就能真正降低机器人训练数据门槛。

带着这个问题,中国人民大学 AIM3 Lab 联手阿里通义千问团队(Qwen Team)等机构提出了 Ego2Robot,这是一条把第一视角人类操作视频规模化转成机器人训练数据的 Pipeline。

团队把约 1,940 小时的第一视角视频,处理成了 18,561 小时、覆盖 15 种机器人构型的合成训练数据,这也是目前最大的 ego-to-robot 数据集;

光是把人类视频过一遍重定向 + 渲染对齐,就能从 28.1% 拉到 31.7%(+3.6),再叠多构型和原始视频还能继续涨到 37.3%。

下面我们就从方法讲起,一步步看这条 Pipeline 到底是怎么搭起来的。

01

Ego2Robot 怎么把人类视频

变成机器人训练数据

Ego2Robot 的 Pipeline 直接对应三个核心难点:人手姿态怎么变成机械臂末端轨迹,画面里的人手怎么换成同场景的机器臂,合成数据里有多少真能用。

它支持两条输入路径,已有手部姿态标注的数据集直接进,纯视频则先估姿态。

同一条人类视频还能并行渲染成 15 种机械臂(Panda、UR5e、Franka 等),这是数据能放大到近两万小时的关键。

动作对齐从 21 个手部关键点里提取夹爪表示:用指尖位置算出工具中心点和开合宽度,再定义抓取朝向。

左右手用正负号统一坐标系,轨迹再做平滑,并按数据来源下采样,把人类操作的速度拉到和机器人接近。

视觉对齐先用分割和修复把人手抹掉、重建背景,再在轨迹附近搜索合适的机械臂基座位置,用逆运动学验证可行性,最后从原相机视角渲染并合成回去。

不同构型的基座各自独立搜索。

质量筛选分三级:Pipeline 内标记 IK 失败、碰撞、离群等;统计层剔除极端值和不连续轨迹;语义层用大模型检查动作意图是否一致,不一致的直接丢弃。

输出统一用相机坐标系下的相对末端动作,避开未知相机标定带来的麻烦。

整条 Pipeline 把人类视频系统性地转成可用的机器人训练流,重点解决了本体差异和数据可用性。

02

评估框架

现有评测(比如原 RoboTwin 2.0)常把背景、光照、物体、构型等多种偏移混在一起,只给一个 OOD 总分。

这带来一个很实际的问题:模型一旦掉点,你根本分不清是视觉不鲁棒、换个场景就懵,还是跨构型失败了,归因无从下手。

Ego2Robot 在 RoboTwin 2.0 上做了扩展,拆出 11 个相互独立的扰动设定,把泛化拆成四个可以单独测量的维度。

1)视觉外观:单独控制背景纹理、光照和机器人颜色三种偏移,其中背景和光照是从原来打包的随机化里解耦出来单独测的;

2)场景布局:单独控制桌面高度(± 4cm)、干扰物体和相机偏移(± 5cm),同样各自独立;

3)本体构型:把默认构型 Aloha-Agilex 零样本替换成 UR5、ARX、Franka 三种机械臂,看相机坐标系下的动作表示能否不做构型专属微调就迁移过去;

4)任务语义:用 50 个任务里训练时没见过的物体实例、以及 505 条口语化改写的指令,来测物体外观和语言表述的鲁棒性。

此外还接入了外部基准 EBench,它的相机架设更高、更接近第一视角视角,提供 7 个桌面任务。

这样把各个轴拆开之后,混合训练带来的收益到底来自视觉不变性、构型迁移还是语义泛化,就能精确归因,而不是笼统地报一个数字。

03

性能评估

(1)实验配置

我们采用 VLA 架构,以 Qwen3.5-4B 作为视觉语言骨干,Diffusion Transformer(DiT)作为动作头,以 8 步扩散预测相机坐标系相对末端执行器表示中的 32 步动作块。

所有预训练配置保持相同超参和训练帧数,比较公平。

预训练数据比较四种配置:

仅机器人数据(DROID+AgibotWorld+InternData,约 6,565 小时),以及 Ego2Robot 合成数据(Ego2R)与机器人数据按 1:3、3:1 和 1:1 比例混合。

所有模型在 RoboTwin 的 50 个干净任务上微调,并在每种扰动设置下评估。真实机器人实验在 ARX ACone 平台上测试 5 个长时程任务。

(2)核心结果

主结果很清晰,混合训练普遍提升 OOD 泛化,比例很关键。

纯机器人基线在 Clean/Rand/EBench 上是 62.2%/50.9%/39.6%。

1:3 基本持平,1:1 和 3:1 提升明显,1:1 在多数指标拿第一(Clean 68.1%、Rand 53.5%、EBench 49.8%),3:1 在 EBench 上最好(+12.1)。

收益主要来自视觉外观和任务语义,场景布局中等,本体构型也有迁移(见过 15 种构型的帮助),但运动学差距过大的构型仍很难。

消融进一步验证了 Pipeline 价值。纯人类视频直接共训效果有限,过一遍 Pipeline 后提升,构型数从 1 增到 15 再提升,再混入原始人类视频还能继续涨。

真实机器人上,把随手录的第一视角视频过 Pipeline 生成合成数据,再按 1:1 混入微调,五个长程任务全部最好。

整体来看,Ego2Robot 合成数据与真实机器人数据合理混合,能有效增强 VLA 的分布外泛化。

(3)真实机器人实验

我们在 ARX ACone 平台上测了五个长程任务:放水果、放积木、叠毛巾、扫垃圾、拧螺丝。每个任务只有 20 条遥操作演示。

对比三种设置纯机器人数据、混合预训练(Ego2R+Robot 1:1)、以及在混合预训练基础上,把场景里随手录的第一视角操作视频(每条约 7 分钟)过 Pipeline 生成合成演示,再混进微调数据。

结果很直接最后一种设置在五个任务上全部最好,放积木提升 14 个百分点,拧螺丝提升 13 个百分点。

说明随意录的第一视角视频,经过这条 Pipeline 就能变成有效的训练信号。

04

总结

Ego2Robot 把「重定向 + 渲染」这条路线,从过去的小数据、单任务验证,推到了 18561 小时、15 种构型、能支撑 VLA 预训练的规模,并配了一套能把收益归因到具体扰动轴的评测。

实验结果指向一个朴素但有用的结论:第一视角人类视频里的操作先验,经过动作和视觉对齐后,主要补的是机器人数据在视觉、构型、语义上的泛化短板,而不是简单堆轨迹。

论文也如实列出了边界,重定向只到平行夹爪,丢掉了手指级精细运动;视觉对齐在重度遮挡或复杂光照下可能引入瑕疵;评测仍局限在 RoboTwin2.0 任务范围。

对想用人类视频低成本扩数据的人来说,最值得借鉴的是整套工程思路——把「无本体的人手轨迹」通过网格搜基座 +IK 可行性对齐到具体机器人构型,再用多级筛选兜住合成质量。

关注 + 星标,获取 AI 前沿进展与开源一线动态

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 机械臂 阿里 中国人民大学 破局
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论