量子位 昨天
硅谷今日最热具身模型!不用后训练,看一遍就学会
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

具身智能的大结果,要来了!!!

自上周 Generalist 发布能够学习 3 到 12 秒动作的具身大脑 Gen 1.5 以来~

刚刚,北美具身初创Skild AI又发布了全新机器人基础模型S1,直接把机器人上下文学习的任务长度拉到了10 分钟往上

这次的 S1 主打上下文学习(in-context learning,ICL):

无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能 " 照猫画虎 ",直接完成一整套从未见过的复杂操作流程。

在官方演示里,机器人完成了煎饼、冲泡咖啡、给植物换盆,以及设备组装等长程任务。并且在未见过的任务上,把成功率干到了 66%,远超基于语言提示的 VLA(只有 9%)。

另外,哪怕是走传统后训练微调的路线,想追平 S1 只看一次演示的效果,大概也要喂进去 380 次左右的任务演示。

非常 amazing!

可以说,最近这一波集中在上下文学习的工作,又给不少人重新燃起了对具身的希望。

有推特网友表示,通用机器人可能两年后就会出现,而不是七年。

还有网友表示,从 Rhoda,到上周 Generalist,再到现在 Skild S1 的 10 分钟任务,机器人真正的 GPT 时刻似乎正在出现。

因为一旦这种能力真的泛化,以后开发机器人技能,可能真的会变得像给 ChatGPT 写 Prompt 一样。

真有这么神吗?我们一起来看。

从 BERT 时代,迈向 GPT 时代

想要理解 S1 这次到底怎么个上下文学习,咱们得先看看,传统机器人是怎么学习一个新技能的。

在传统的 pipeline 里,机器人学习其实和大模型差不多:

先在海量数据上进行预训练,学会一些基础能力;然后到了具体场景,再针对某个任务收集数据,通过后训练,让机器人学会专有技能。

只不过问题在于,机器人和大模型虽然流程差不多,但数据成本却完全不是一回事。

大模型的预训练数据,大量来自互联网;哪怕到了编程、Agent 这些专门场景,很多后训练数据也可以在线上快速获得,甚至自动生成。

但机器人就比较惨了。预训练数据得在现实世界里采,后训练数据还是得在现实世界里采。

所以,在技术博客中,Skild AI 就直接开麦了:

如果一个机器人基础模型,每学一个新任务仍然需要几十、几百小时真机数据,再重新后训练,那我请问,这个 " 基础模型 ",基础在哪儿?

他们甚至引用已有研究指出,如果针对一个新任务的数据已经足够多,那么从零训练的模型甚至都可能追平经过预训练再微调的基础模型。

所以,具身预训练的意义到底是啥?

对此,Skild 给出的答案是:上下文学习

为了有一个参考坐标,Skild 拉来了大模型的发展路线作为对照。

早期的 BERT 已经很强了,但每碰到一个新任务,往往还是得重新准备数据,再微调一遍。

真正改变游戏规则的,是后来 GPT-3 之后逐渐显现出来的上下文学习能力:

不用改模型权重,只要在 Prompt 里给几个例子,模型就能临时 " 学会 " 一个新任务。

基于此,Skild 认为,机器人现在其实还困在类似的BERT 时代,他们真正想要的是,是让机器人也完成同样一次范式转换。

也就是说,预训练真正的价值,不应该只是让后训练少采一点数据,而是让机器人最终获得 " 从上下文里直接学习 " 的能力。

上下文学习

那么,S1 这次到底从上下文里学到了什么?

Skild 认为,真正能检验机器人上下文学习能力的,其实就两个维度:

一个是,能不能学会训练时根本没见过的新技能;另一个是,能不能把已有技能重新组合起来,完成一个很长、很复杂的新任务。

比如,机器人只需观看一段翻煎饼的视频,就能学会如何制作煎饼——

即便这项技能此前从未出现在它的训练数据中。

与此同时,相较于上周 Gen-1.5 展示的秒级视频,S1 这次直接把上下文学习拉到了最长 10 分钟

在植物换盆等任务中,每个任务都需要连续完成几十个操作步骤。在这些长程任务的演示中,机器人不仅需要做到照猫画虎,还需要知道:

我现在做到哪一步了,下一步该干嘛,技能之间怎么组合,中间搞砸了又该怎么继续。

也就是说,机器人需要真正理解视频演示里任务 - 动作的意图,见招拆招、随机应变,而不仅仅是行为克隆那么简单。

此外,在植物换盆任务中,从开始录演示,到机器人自己上手,只花了 11 分钟,直接在效率这一块,给传统后训练秒了。

最后,在整个过程中,S1 没有用 fine-tuning,也没上 post-training,模型权重完全不变,用同一套权重,就完成了博客里展示的所有任务。

基本对齐了大模型从 Bert 需要特定场景微调,到 GPT-3 只看演示就能完成 OOD 任务的跨越。

唯一的不同就是,用的 prompt 不再是语言,而是用了能够更好对齐下游任务的动作视频。

实验:ICL 到底是不是更能 scale?

在实验部分,Skild 先在(训练数据)见过的任务和未见过的任务上,对比了 ICL 视频 Prompt 和传统的语言 Prompt VLA。

测试结果表明,当训练数据只有 1000 小时时,语言 Prompt 效果更好,而随着数据规模增加,ICL 开始反超。

到了 10 万小时,训练时见过的任务上:ICL 96%,语言 Prompt 89%。

而在真正关键的 OOD 任务上:ICL 66%,语言 Prompt 只有 9%,直接拉开了 7 倍以上的差距。

为了验证 S1 的泛化性,Skild 又在不同的实验条件下进行测试。

结果表明,语言 Prompt VLA 的性能下降幅度,最高达到 ICL 的 3 倍。

也就是说,ICL 学到的不是固定场景里的动作复读,而是更能跟着当前环境重新规划怎么做。

最后,在 One shot learning 方面。

S1 在新任务上完全不做 post-training,只看一条视频演示,成功率就达到 66%。

相较之下,传统 VLA 则大概要经过约 380 次演示的后训练,才能追到同样水平。

当然,继续堆到 2000 次演示后,传统 post-training 最终能做到 86%。

所以结论可能不是 " 以后机器人不用训练了 ",而是:

以前一个新技能可能得教几百遍,现在先看一遍,就能直接做到六七十分。

这也是 Skild 所谓的 ICL scaling law:

数据越多,模型不只是会更多技能,而是越来越会 " 从演示里学技能 "。

Skild AI 是谁?

Skild 成立于 2023 年,背后站着两个 CMU 机器人圈的老熟人:Deepak Pathak 和 Abhinav Gupta。

两人都是卡内基梅隆大学机器人研究所的教授,Deepak 主要研究机器人学习、强化学习和计算机视觉,Abhinav 则是计算机视觉、自监督学习领域的大神。

早在 2022 年,两人就合作过 WHIRL,让机器人通过观看人类视频进行 one-shot imitation,可以说 S1 这条路线,也不是突然从石头缝里蹦出来的。

作为北美具身圈的明星企业,2024 年 Skild 刚走出隐身模式,就拿下 3 亿美元 A 轮、估值 15 亿美元;

到了今年 1 月,又完成 14 亿美元 C 轮融资,估值直接干到了 140 亿美元以上,SoftBank 领投,英伟达、贝索斯等继续上桌。两年多时间,估值接近翻了 10 倍。

横向对比来看,Skild 在北美具身圈的定位也相当特殊。

相比于 PI 更像是在搞 " 机器人 GPT",Generalist 最近强调的是 one-shot learner,以及 Genesis AI、Sunday 最近的全栈势头,Skild 一直强调的是一句话:Any robot,any task, one brain

它更强调跨 embodiment,希望同一个 Skild Brain 能够跑在机械臂、四足、人形等不同身体上。

说的通俗一点,就是想成为机器人时代的安卓:一个智能层,塞进各种不同的身体里。

这也由此决定了 Skild 的数据策略:全都要

Skild 把机器人数据看成 hardware proximity、diversity 和 scalability 三个维度:

真机遥操最接近硬件,但贵;第一视角人类视频最容易规模化,但和机器人身体差得远;仿真便宜能猛造,却又有 sim-to-real gap。

所以他们对于 Robot Teleop、UMI、Egocentric Video、Simulation,基本上采取的就是都用的策略。

而 S1 的 ICL,其实也是这条路线自然延伸:

2025 年 9 月 LocoFormer → 2026 年 2 月首次 In-Domain ICL → 5 月第一次翻煎饼 → 8 月 S1 发布,直接把上下文学习推到最长 10 分钟的 OOD 长程任务。

所以现在真正值得关注的问题,可能已经不是机器人还能不能学会更多技能,而是:

机器人学习一个新技能的成本,能不能真的从 " 教几百遍 ",变成 " 你做一遍,它看一遍 "。

如果这个 scaling law 还能继续成立,那所谓机器人的 GPT moment,可能真的不只是又一个营销梗了。

参考链接

[ 1 ] https://www.skild.ai/blogs/s1

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论