量子位 23小时前
神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

还记得上周具身圈流传的那个神秘 10 分钟一镜到底视频吗?

视频一出,网友们表示:这是机器人领域的 " 吓到瘫坐,宛如看见核爆 " ……

甚至给出了最高评价:是 AI 生成的吧?!

同行跑来打听到底是哪家的,听说有头部公司专门开会研究……我们的后台都被各路网友问爆了。

看完这个十分钟的一镜到底视频,大家说具身智能的 ChatGPT 时刻可能真来了,有人说这是具身智能的重要里程碑,也有人说这是创新的架构。因为它让人看到了:

机器人具有一定认知能力,而不是概率预测;

机器人理解人类行为逻辑,而非过拟合;

机器人拥有持续自进化的能力,有很多令人惊叹的瞬间。

当然,由于机器人表现得太过 " 科幻 ",也有一些不相信的人质疑:这是不是遥操的?(虽然团队说这么小的空间真的不知道怎么遥操)

而这个神秘团队,回应质疑的方式也很特别:他们又一连甩出了另外几个 demo,依旧粗糙,依旧一镜到底,仿佛想说:

" 智能,不管你信或不信,它真的要来了。"

因为第一篇文章,我们得以联系到神秘的模型团队,也表达了疑问——为什么不直接出来认领?得到的回应是:模型也像人,让它自己说。

我们了解到,这个神秘模型的内部代号为 "MVP",它的意思是:模型能力像真人一样(Make Veritable People),他们说可以直译为:" 做个人吧 "(doge)。

" 做个人吧 " 大模型。

而这次释出的几个 Demo,从表现来看,机器人 " 真的做了个人 ",它像人类一样思考,自我决策、动作丝滑、逻辑自洽。而且听团队说,他们马上要让机器人自己上街了,开放环境,直接给大家看。

视频 1:手眼协调不分离,高超的动力学理解

如果你端着一瓶水,有人戳你的胳膊,你能不能瞬时反应、让水不洒?

机器人左手拿一个装着水的杯子,在人类(无礼的)木棍推搡下,它躲向另一侧,又平稳地归位,杯中的水没有洒半滴。

如果你端着一瓶水,有人戳你的胳膊,又同时推倒了你旁边的易拉罐,你能不能瞬时反应、让水不洒且保证易拉罐不倒?

人类又从右侧推了桌上的三个易拉罐,它的右手居然同时扶住了易拉罐。

机器人表现得就像一位太极宗师,既会化劲,将对手的撞击化解于无形,也知道分寸,将力道拿捏得刚刚合适。

而且仔细看,易拉罐被推动的时候,左臂端着水的动作还没有恢复,机器人又用右手扶住了易拉罐。

这一幕,别说机器人,其实已经超越许多人了,大家可以试试看能不能两只手同时完成这两个任务。(doge)

主流的 VLA 和 WAM 模型有个毛病:一旦面对遮挡、接触、形变等需要物理推理的任务场景时,就容易失效。因为它们只是在模仿动作的样子,并不理解背后的物理规律。

而 " 做个人吧 " 模型看起来给机器人装了一个 " 物理大脑 "。正是动力学预测和长期状态的统一,才能让轨迹天然满足动力学可行性。

从动作反应速度跟丝滑程度来看,机器人的动作不再是靠死记硬背数据 " 猜 " 出来的,而是像人一样,靠着对物理规则的理解 " 学 " 出来的。

两者是 " 照葫芦画瓢 " 和 " 知其所以然 " 的区别吧。

视频 2:对空间和物体属性的理解,以及对人类习惯的总结

第二个视频中,人形机器人正式接管家务。而且 " 做个人吧 " 模型的团队说这是机器人 zero-shot 完成这个任务时候的视频。(如果是真的,那这泛化性也太无敌了!)

他们说,模型的 zero-shot 成功率已经达到了 80%。

我把这个视频命名为 " 强迫症机器人之客厅不能乱 "(doge)

只见机器人先把手里的小玩偶放回玄关置物台,主打一个 " 从哪儿来回哪儿去 "。接着,它又把装满杂物的收纳篮拖到身边,微微下蹲,从中先后掏出黑色帽子和紫色健身环,将其稳稳挂上衣帽架。

最后,它从篮子里拿出一只硕大的花朵坐垫,显然它是可以弯腰的,但这次,它选择随手一扔,坐垫落到了沙发上。

整个过程下来,机器人的动作虽然不算麻溜,但颇有一种尽在掌控之中的感觉。

机器人对空间和物体属性的理解,已经非常像人:它知道物体在光滑的地板上可以拖拽,环状的帽子和健身环可以挂,平整的坐垫会自己展开。

甚至还会 " 偷懒 ",能直接扔就绝不再费劲弯腰。(真是懒人驱动科学发展,懒机器人驱动智能进化啊。)

主流的模型暂时还达不到像人一样的泛化能力。VLA 靠 " 大力出奇迹 " 硬算,一碰到陌生场景就容易崩盘;WAM 则像拼积木一样拼接动作,学得太死板,稍微变通一下就不灵了。

装配 " 做个人吧 " 模型的机器人则看起来很稳定,把对空间和物体属性的理解以及人类的习惯融为了一体,顺利完成了一个长程任务。

视频 3:拉平床单、抖床单、放床单,机器人组队干活了

小时候,长辈会经常喊我们,把新洗出来的床单抖一抖。

这个视频中,出现了两台不同型号的机器人,听说他们全部的训练都是看的人类视频,所以他们再次上演了 " 一脑多形 " 的跨本体协作,并且真的组队干活了。

只见一条似乎刚从烘干机中取出来的床单,一头的两角被一台身高较高的机器人拽着,另外一头的两角被另一台较矮的机器人牵着。

较矮的机器人一跨步,再一弯腰,床单便被扯得平整。紧接着,身高较高的机器人两手轻轻抖动了几下床单。

虽然视频中的机器人姿势仍然有些呆板,但是它们的行为逻辑也太像人了!这跟我们把刚洗好的衣服甩两下、以免出现褶皱有什么区别?

要知道,主流的模型有个致命缺陷:它们不像人类,无法真正实现自进化。VLA 只能小修小补,动不了 " 脑回路 ";WAM 干活太死板,换个环境就适应不了。

而 MVP 模型不同,它看起来把对物理世界的理解和对人类逻辑的理解统一了。

视频 4:能量驱动,最优能量的行为解

当机器人学会思考,懂得一次把所有东西拿走归置,比来回一趟趟归置更省力,它会怎么样?

视频里,这台机器人收纳物品的操作仿佛人一样:东西再多,也尽量不跑第二趟。

它先从篮子里抽出一条黑色围巾,像店小二一样,往脖子上一搭。接着它又拎起紫色圆环,绕在小臂上,还知道抬手让其滑落到肘关节处,成功把自己改造成行走的衣架。

然后是拖鞋、耳机,一番操作下来,机器人身上已经挂满了物品,却淡定地转身离开,留下一个轻飘飘的背影。

1 分钟的视频,机器人收纳了 4 件物品,不仅充分展现了处理长程任务的能力,还展现了对每个物品的深刻理解,并能为每件物品建立与自身能力的对应映射。

要知道,如今的主流模型做同样的任务,大概率会是一件一件单独搬运,因为模型本质上还是基于统计拟合的猜测,缺乏像人类一样对世界的理解,也没有自主意图。

如果视频中的机器人看到这一幕,它心里的 OS 可能是:不是吧哥们,来都来了,怎么就带这点走啊?多带点更省劲啊!

" 做个人吧 " 模型的机器人做决策时,好像不需要刻意去 " 想 " 下一步该干嘛,只需要像水往低处流一样,顺着能量下降的方向自然滑动。

在这个 " 下坡 " 的过程中,思考、探索和行动是一气呵成的。

可能这才是真正理解世界、并有自主意图的智能吧。

总结

看完这 4 个 demo,我终于理解了模型为什么叫 " 做个人吧 ",机器人的一举一动,确实都太像一个人的决策过程,在长程任务、干扰环境、彼此协作中,表现出对于物理世界、人类行为逻辑、自身能力的不断学习跟进化。

机器人能像人一样理解空间和物体属性,干家务时的思维逻辑和操作习惯和人差不多,还能如同人类一般自我驱动、自主学习、持续自进化。

不仅如此,机器人还体现出这些特质:

动作一致性:机器人就像 " 成熟人类 " ——逻辑自洽、动作丝滑、懂物理、手眼协调。

思考持续性:机器人不 " 半途而废 " 且 " 越用越稳 ",长时序环环相扣。

甚至还有个性:装载 " 做个人吧 " 大模型的机器人仿佛每个人都有自己 " 做事的独特调调 ",好像有了性格。

其他特点,不一而足,但我现在真的开始相信,具身智能真正能为人所用的时刻已经快到来了。

智能,可能已经真的涌现了,在我们看不到的地方。

你对这几个新 Demo 怎么看?欢迎来评论区互动留言,咱们一起给点鼓励和压力,逼出技术团队现身说法,是回应也是交流~~

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论