足球界的 AlphaGo 来了!
在 " 虚拟世界杯 " 自我对弈 140 年后,终于带着球技出山。
视频中的人形机器人 "Messinator" 穿着阿根廷队服,丝滑地带球过人,一脚射门:
这一成果来自美国具身智能独角兽 Skild AI。
有网友看完忍不住感叹:
最妙的是奖励函数只给了进球,盘带、护球、倒地爬起来全是自己 " 悟 " 出来的。
AlphaGo 那套 self-play 方法论又在物理世界又走通了一次;
虚拟世界杯踢 140 年,值了!
那么这个 Messinator 究竟是一个怎样的机器人?
造出它的 Skild AI 又是什么来头?
看下去就知道了。
" 梅西终结者 ",在虚拟世界杯苦练 140 年
Messinator 这个名字拆开看很有意思。
它的前半截是梅西(Messi),后半截来自经典科幻电影《终结者》里的机器 Terminator,把这俩合在一起就是" 梅西终结者 "。(big 胆 hhh)
它真正大脑是 Skild AI 此前推出的旗舰机器人基础模型S1。
而 S1 最核心的能力,就是让机器人像大模型一样 " 上下文学习 "。
我们只需给它看一段任务示范视频,它就能把视频当作 " 提示词 ",逐步理解咱们想完成什么任务,并把视频里的意图和动作转换成适合自己身体的执行方式。
最爽的是,它碰到新任务不用回炉重造,直接就能上手。
不过,会看视频还只是第一步。
Skild AI 认为,像 S1 这样的基础模型主要从人类数据中学习,能力上限难免受人类经验限制。
如果想继续变强,就得让机器人自己创造经验,并尝试着自己去发现人类没教过的动作。
于是,Skild AI 又在 S1 基础上加入了强化学习和self-play,也就是自我对弈。
它的整个训练设置并不复杂,团队把机器人放进了 NVIDIA Isaac Sim 搭建的虚拟足球场,并只给它设定了一个最终目标:进球,拿到高分。
然后,在整个训练过程中,没有人为盘带单独设置奖励,也没有人为护球、抢断、射门和倒地起身逐一打分。
机器人面对的对手,只是自己此前保存下来的模型版本。
通过新旧版本反复比赛,赢下来的新策略,又会成为下一轮训练中更难对付的对手。
于是,每一次进步,都会为机器人自动制造出下一道难题。
Skild AI 技术博客显示,机器人刚进入虚拟球场的前几个月连走路都不利索;
但等它 " 长到大学生的年纪 ",便自行学会了摔倒后重新站起来。
而随着对手不断变强,机器人盘带绕过防守、用身体护球、主动抢断等更复杂的行为也开始陆续出现。
全程没有工程师规定它必须这样做;
它保留下这些动作只有一个初心:它们能帮自己赢球。
这正是 self-play 最迷人的地方。
当年,AlphaGo 正是通过与自己对弈,逐渐发现了一些连顶尖棋手都没预料到的下法,并于 2016 年 4:1 一举击败韩国传奇棋手李世石九段,正式拉开了 AI 变革的序幕。
现在,Messinator 也通过自我对弈、在虚拟世界踢了 140 年世界杯,将足球策略迁移到了真实人形机器人上。
最终,Messinator 不仅能走到球前完成射门,还学会了带球、护球、抢断,并在真人对抗中调整自己的位置和动作。
Skild AI 通过这场硬核的演示,充分证明了机器人不一定都要由人类亲手教会新动作;
它也可以自己练、自己输、自己总结,再自己变强。
而这,恰好就是 Skild AI 过去几年一直在押注的方向。
一颗大脑,控制所有机器人
2025 年 7 月,Skild AI 正式推出了一套能够跨硬件运行的机器人基础模型——Skild Brain。
它的核心主张是:
Any robot, any task, one brain.
目标是打破 " 一种身体配一套大脑 " 的行业桎梏,让不同形态的机器人执行不同任务时都可以使用同一颗大脑。
随后没过两个月,Skild 又进一步公开了一组omni-bodied 训练成果。
团队在仿真世界中生成了约 10 万种身体结构各异的机器人,让同一个模型累计训练约 1000 个仿真年。
到了测试阶段,模型还得直接接管训练时从未见过的机器人。
哪怕机器人突然断腿、关节锁死、轮子卡住,或者背上额外负重,模型也不会立刻 " 趴窝 ",而是会根据身体状态在线调整重心和运动方式。
部分情况下,它甚至只需几秒钟的时间就能重新找回平衡,并摸索出新的移动方法。
这套 omni-bodied 训练体现了 Skild 最核心的思路:
机器人见过的身体越多,就越难靠死记硬背过关。
为了能同时控制 10 万种不同的身体,模型只能尝试理解平衡、关节、重心和动力之间更通用的物理规律,而不是背下一款机器人的固定步态。
如今的 Messinator,正是延续了这条技术路线,并进一步叠加了 self-play。
其中,Skild Brain 负责赋予它控制身体、保持平衡和应对碰撞的基本功;
self-play 则负责让它思考 " 下一步该怎么做,才会更好?"。
而从 10 万种机器人身体,到 140 年的虚拟世界杯,Skild 这条看似疯狂的技术路线并非横空出世。
把这些想法从论文一路推向真实机器人的,是两位在机器人学习领域深耕多年的卡内基梅隆大学教授。
两位 CMU 教授,联手造机器人大脑
Skild AI 成立于 2023 年,脱胎于卡内基梅隆大学(CMU)机器人研究体系。
团队成员既包括来自卡内基梅隆大学、斯坦福大学、加州大学伯克利分校等高校的研究人才,也包括曾任职于 Meta、Tesla、NVIDIA、Google、Amazon 和 Everyday Robotics 等机构的研究员及工程师。
△Skild AI 团队,图源官网
而联合创始人兼 CEO Deepak Pathak的经历,几乎串起了 Skild AI 的整条技术路线。
△Deepak Pathak
他本科毕业于印度理工学院坎普尔校区计算机专业,后赴加州大学伯克利分校攻读计算机博士,师从计算机视觉领域知名学者 Alyosha Efros 和 Trevor Darrell。
博士毕业后,他曾在 Meta(前 Facebook)AI Research 从事研究工作,也曾在伯克利与机器人学习专家 Pieter Abbeel 合作,担任访问博士后。
此后,他进入卡内基梅隆大学,成为机器人研究所和机器学习系教授。
Deepak Pathak 最具代表性的研究之一是" 好奇心驱动的探索 "。
这项研究等基本思路是,与其让机器只能依赖人类设计的外部奖励,不如赋予它一种内在动力,让它对陌生和难以预测的现象产生 " 好奇 ",并主动探索环境,并在探索中学会新的能力。
Deepak 这套研究思路后来又延伸到自监督机器人学习、视觉模仿学习、Sim2Real 和自适应控制等方向。
在创办 Skild AI 之前,Pathak 还曾联合创立人脸识别公司 VisageMap(该公司后来被 FaceFirst 收购)。
Skild AI 的另一位联合创始人兼总裁Abhinav Gupta,博士毕业于马里兰大学计算机系,现任卡内基梅隆大学机器人研究所教授;
△Abhinav Gupta
他曾参与建立 Facebook AI Research 匹兹堡实验室,并担任研究管理和领导职务。
并长期专注于研究大规模视觉学习、自监督学习、终身学习、机器人操作和物理常识,是早期 " 让机器人通过自主交互收集训练数据 " 路线的重要研究者。
曾获得斯隆研究奖、PAMI 青年研究员奖、IAPR J.K. Aggarwal Prize 等奖项。
Anyway,家人们,你们说要是哪天 "Messinator" 真进化到能踢世界杯,像当年 AlphaGo 对战柯洁那样,跟梅西来一场世纪人机对决,咱们能受的了吗?
参考链接:
[ 1 ] https://x.com/SkildAI/status/2102807731564662797
[ 2 ] https://www.skild.ai/blogs/physical-self-play
[ 3 ] https://www.skild.ai/blogs/s1
[ 4 ] https://www.skild.ai/blogs/building-the-general-purpose-robotic-brain
[ 5 ] https://www.skild.ai/blogs/omni-bodied
[ 6 ] https://www.cs.cmu.edu/~dpathak/
[ 7 ] https://proceedings.mlr.press/v70/pathak17a.html
[ 8 ] https://www.cmu.edu/news/stories/archives/2018/july/facebook-ai-research.html
[ 9 ] https://www.cs.cmu.edu/news/2021/gupta-wins-aggarwal-prize-self-supervised-learning
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦