10 万小时数据开源,机器人开窍时刻,物理 AI 新棋局谁能赢。

许赴清闲
我最近在浏览各类信息的过程当中,注意到了一条相关的新闻,说的是光轮智能这家公司,把 10 万小时的人类行为数据当作开源资源来提供给大众,任何一个人都可以凭借免费的方式对它进行下载和使用。起初对于这件事,我并没有太过在意,后来发现连 Hugging Face 这个平台都出面为它做了站台支持,这个时候我才开始仔细地做了一番研究。原来这些数据并不是普普通通的视频内容,而是带有深度标注特性的一种全模态数据,里面包含了手部动作的细节、身体姿势的形态以及任务语义的各个方面。
在过去的这个时间段里,这些数据往往是各家机器人公司所拥有的核心资产,它们都会秘而不宣地保存起来,如今突然被公开了出来,整个行业都可能因此受到一定的震动。我有一个朋友,他所从事的是机器人方面的工作,他说这个情况就像当年电脑系统被当作开源资源来使用一样,或许会在一定程度上改变游戏规则的走向。
为什么 10 万小时这个数据会显得如此关键呢?这是因为机器人的学习过程当中存在一定的规律,把数据喂给它越多,它就会变得越发聪明。尤其是人类示范方面的数据,有公司把 100 万小时的视频当作训练素材来使用,随后发现机器人的能力提升与数据量之间是成正比的,并且当中还存在一个拐点,大约在 1 万到 10 万小时这个区间范围之间。一旦跨过了这个门槛,机器人就会突然开窍,能够理解各类不同的任务,甚至还能够跨不同的机器人进行迁移。
光轮智能这一次所开源的数据正好是 10 万小时,恰好卡在了这个拐点的位置上面。所以有很多人认为,这相当于把机器人开窍的密码给公开了出来。而且 Hugging Face 这个平台,平时很少会为第三方项目发声,这一次却破了例,这在一定程度上说明了他们认可这批数据能够填补物理世界基础模型方面的空白。
这批数据好在哪里呢?不仅仅是数量方面比较大,关键是质量方面也比较高。在采集的时候,并不是随意地拍摄,而是按照任务、场景以及环境这些方面做了精心的规划,覆盖了工业、物流、零售、家居等机器人实际应用的相关领域。总计下来有一万五千多个独立场景,一万五千多个任务,以及七大类环境类型,场景的广度相对此前数据集来说,高了一个数量级。
并且标注的精细程度也是极其高的。除了视频内容之外,还包含了手部 21 个关节点的精细动作、身体姿势以及每一步的任务逻辑信息。这个情况就像是在给机器人编写教材一样,不仅仅告诉它手应该如何动,还要对它解释为什么需要这么做。在 10 万小时这个量级上面实现如此精细的标注,工程的投入是相当巨大的,一般的公司往往舍不得花这个钱。
他们还加入了一个比较巧妙的设计,也就是腕部摄像头。在使用头戴摄像头进行拍摄的时候,手部常常会被遮挡住,尤其是在进行灵巧操作的时候。有了腕部视角的辅助,就能够看清手的动作细节。这个设计在公开数据集当中是极为罕见的,可以称得上是精品。
除了数据本身这个方面,光轮智能还构建了相对完整的系统。不单单是开源了数据,还搭建了仿真平台、评测平台以及部署平台。也就是说,当你拿到教材之后,可以在模拟环境当中进行练习,参加标准考试,等到合格了,再到真实环境当中进行工作,如果表现不佳,还能够得到反馈并且做出改进。
这个闭环的设定是很有意思的。在过去,机器人的训练往往是割裂开的,数据、模型以及部署这些方面各自独立,迭代的速度相对缓慢。如今他们把各个部分整合成了一整套系统,从人类数据到仿真训练,再到评测筛选以及真实部署,失败的数据还能够回流,补采新的数据再重新进行训练。这样一来,机器人就能够实现自我进化,不再是一个僵化的产品了。
所以,光轮智能所做的不仅仅是在售卖数据,而是在建设基础设施方面的工作。他们把这批数据当作开源资源来使用,实际上是在推广自己的标准。目前各家公司的数据格式并不统一,无法混在一起来使用。有了统一的标准,大家都能够对齐,论文的对比也变得相对方便,模型的预训练也有了基础。这个情况就像当年互联网的 HTTP 协议一样,谁先立下了标准,谁就抢占了先机。
他们还是 EgoVerse 和 Newton 这两个国际委员会当中唯一的中国公司。这两个委员会,一个负责管理数据标准,一个负责管理仿真标准,都是用来定义物理 AI 底层规则的地方。与英伟达、谷歌 DeepMind 以及迪士尼研究院这些巨头公司共同制定标准,说明中国企业已经参与到全球规则制定的过程当中了,不再只是单纯的跟随者了。
有人说,把如此昂贵的数据当作开源资源来使用,岂不是亏了吗?其实这是用短期的利润来换取长期的生态。数据免费了,使用的人就会相对多起来,大家习惯了这个标准,后续产生的数据也能够融入进来。等到标准确立之后,他们提供更高级的仿真、评测以及定制化服务,就能够获得盈利。这是一个明智的做法,而不是愚蠢的行为。
最后,他们还有一个五年计划,要共同建设 100 亿小时的数据。这个数字听起来是比较夸张的,但如果真的能够实现,就相当于把人类几百万年以来积累的干活经验,全部翻译成机器能够理解的语言。这项工程是相当浩大的,就像是在给机器人编写百科全书一样,需要全行业共同的努力。
10 万小时的开源,仅仅只是一个开始。它让机器人从数据太少学不会的状态,进入到了有数据可以学的时代。但能否真正把它用好,还得看整个行业如何进行协作。密码已经公开了,接下来就看谁学得相对快、用得相对好了。作为一个普通人,我觉得这件事是值得关注一下的,说不定以后家里的机器人就是按照这个标准训练出来的。


登录后才可以发布评论哦
打开小程序可以发布评论哦