"人类因为怕死产生的安全意识刻在 DNA 中,但机器人对安全的理解仍很欠缺。"
出品:财经涂鸦(ID:caijingtuya)
公司情报专家《财经涂鸦》获悉,9 月 11 日,蚂蚁灵波科技于 2026 Inclusion · 外滩大会期间,举行 " 基座之上:具身智能的场景突围与协同进化 " 论坛。多位具身智能领域年轻科学家、数据专家与百亿具身企业掌门人齐聚,围绕通用大脑、数据飞轮与场景落地展开讨论。
今年大会展示的药房场景中,搭载蚂蚁灵波通用大脑的机器人可以在 80 厘米宽的货架通道中完成药品识别、分拣与交付,并已进入真实门店承担夜间分拣工作。
从技术演示到稳定工作,从单个场景到 " 一脑多机 ",具身智能正在向产业落地迈进。但模型如何提升泛化能力,真实场景数据如何持续获取,机器人如何可靠完成长程任务,仍然需要行业共同探索。
针对上述问题,蚂蚁灵波科技首席科学家沈宇军在论坛圆桌中,提出诸多兼具前瞻性与实用性的观点。
尝试解决新问题,不要一味复用大模型结果
Q:站在产业落地的角度,如果让一套模型能够在物理环境中长期稳定地落地,并且具备一定鲁棒性,需要的能力优先级如何排列?
沈宇军:这一波具身智能最核心的应该是通用性和泛化性。传统机器人的控制已经做得非常好,而现在我们希望机器人能在真实场景中提高纠错能力,或对不同情况进行泛化。
过去一年,我们在上述方向做了很多努力。但现在回看,当时可能把具身这件事想简单了。
今年上半年,大家一直在争论的一个话题技术路线,我们也经常被问做的是 VLA 还是做 WAM。但 7 月份我们第二次发布模型后,现在再往回看,会感觉这个争论的本质还是大家过于想走捷径。
现实生活中,机器人离不开两样东西,语言和视觉。模型里面能用的无非两大类,多模态 VLM 和视频生成模型 WAM,核心是 VLM 或者 Video-Gen 在机器人身上的应用。
如果参照自动驾驶的发展路径,我们是不是可以依赖自己的数据重新开发一个工具?如果可以,那么 VLA 还是 WAM 都会变得不重要,更重要的是工具正向开发的过程,以及思考机器人究竟需要什么样的能力。
我们总结下来就三件事。
第一,如何从传感器的原始信号中处理出更好的 Token。物理世界与数字世界最大的不同,是所有的信息一定来自传感器,所以我们面临的问题是,传感器信息源源不断输入时,机器人如何得到好的 Token。这种 Token 代表了对某一种模态信息的理解、对空间的理解、对力的理解等等。
第二,如何把这些信息融合到一个模型里面,即所谓对齐;第三,基于对齐的所有观测,给出一个好的、能够执行的动作。
可以类比人,机器人要先打造好感官,包括眼睛,鼻子,手,皮肤等;然后把感官信息同步转变成神经信号传到脑子;再用脑子基于这些信息做动作处理。
数字模型是否能够真正解决这三类问题?我觉得不全能。
一定有些东西是现在大语言模型或其他模型没有接触过的,这些正是具身玩家应该尝试去解决的问题,而不是一味复用现在的结果,或是看起来对机器人短期更有价值的事情。
因为继续往下走你会发现,有一些门槛是一定要跨过的。所以灵波选择现在就开始跨。
回答行业底层问题,数据的质量和分布更重要
Q:具身从模型到应用需要跨越的最重要分水岭应该是什么?以及过程中,模型能力和系统工程,部署能力各自应该解决什么样的问题?
沈宇军:目前市面上很多讨论其实都偏感性,比如到底需要多少数据才会智能涌现。自动驾驶的数据已经过剩了,每天还在继续积累更多数据,但自动驾驶真正实现了吗?没有。类似问题还有什么数据类型是好的等等。
我觉得可以减少这种讨论,更多关注这个行业到底需要什么。
举个例子,如果想在后训练阶段达到某个效果,是可以堆数据的,但很少有人讲要堆多少。其实里面有一个很重要因素,就是成本,这也是商业落地过程中的关键要素。
比如一个场景中,500 条不行堆 1000 条,1000 条不行 2000 条。然后大家就会去追求另一个目标,新一版模型变强后,再把数据从 2000 条往下降到 1000、500.
但其中有个更本质的问题需要关注,就是我们已经有一个模型,能在一个场景落地,采了 500 条数据的成功率是 90%,如何在采到下一条数据后让它的成功率从 90% 变成 90.5%?或者,我的数据该怎么采才能实现这个目标?这些好像很少有人提及。
我觉得这些在后训练里也是非常关键的因素。大家现在讲数据就讲量、讲类型,没有人讲数据质量或者分布。讲质量也只是空泛地希望数据质量好。那什么样的数据是好的?到底哪条指标达到了才是好?讲分布时也只讲要尽可能均衡,那怎么样算是均衡?哪个维度需要均衡?
这些偏感性的表述之外,我觉得可能需要回答一些更底层的问题。
因为未来两三年或者最多五年后,数据一定不会是稀缺的,甚至可能过剩。所以我希望能更多讨论一些更底层、更有实际价值的内容。这会对行业发展有一些帮助。
具身模型 Scaling Law 仍有效,但技术路线一定不会复刻
Q:目前具身大模型的技术路线非常多,你如何看待这些路线之争的?这种争论是否有意义?
沈宇军:我的观点是,在 AI 大训练范式不发生大变化的情况下,具身模型的 Scaling Law 还是有效的,而且跟数字世界模型一样,走严禁模式。
但技术路线一定不会复刻。因为从任务的角度讲,具身需要处理源源不断的信息,哪怕它给你反馈、执行动作时,传感器的输入也不会停下来。在这样的范式下,它的很多底层技就会天然不一样的。
最近有个很有意思的例子,GPT-6 出来之后,用数字世界模型做具身任务的公司都会觉得很恐怖。他们担心会像数字世界一样,基模能力有一天突然跃迁,很多预训练没有意义了;以及当数字世界的模型不断变强,就没具身什么事了。
我们很少讨论技术路线之争,因为太宏观,没有意义。最有意义的还是我们希望这个模型具备什么样的能力,比如希望它具备能够持续地处理视觉信号、触觉信号的能力,以及把各种信号融合在一起的能力,这种东西时不会变的。
另外,有一点是大模型公司做得比较好、具身公司需要努力追赶的,即大规模预训练能力。这个能力其实是值得敬畏的。从 0 到 1 开发一个大模型,和拿一个大模型微调出另一个大模型,需要的能力是完全不一样的。
模型不是 " 数据 + 算力 " 就结束了。怎样把一堆数据在一堆 GPU 上跑出合理的模型,这个成本或者门槛相当高,可能跟机器人行业落地是同样的难度的事情。但是反而在这一点,大家只会把它统一为三个字,训模型。
基模公司最需要解决泛化性问题,具身仍缺公平评测标准
Q:最近机器人领域有一个热点是上下文学习,如何看待这个方向?
沈宇军:这个事情为什么最近火,可能因为大家看腻了 demo 觉得挺新鲜的,但这个不解决实际问题。我认为当下尤其做基模的公司,最需要解决的问题是泛化性,其他的可以往后放。
其实灵波很早之前就内部讨论过,机器人到底是不是开箱即用的。我觉得可能未必,因为人也未必是开箱即用的。比如你请一个人去你家,你家有一个新鲜的家用电器,你也要看说明书。我比较看中的是,你给它一句话,让它做一件事情,它的执行结果是否和你展示的一样。
这里面还是要讨论,模型本身是否能够支持这件事。
In context learning 模型再火,如果模型本身不支持机器人做这件事,我也不相信人演示一遍它能会。肯定是它本身具备这个能力,只是我用什么方式让它展示出来而已。
Q:怎么看待目前市面上各种评测的榜单?更科学的具身领域评测该如何量化?以及做完这样的测试之后怎么样能够帮助企业更好地和真实场景联系在一起?
沈宇军:通常,评测是能够牵引模型往前走的。但具身模型和大模型不一样,我觉得目前仍然缺少一个真正公平的评测,因为没有一种方式能够真正把各个模型拉到一起去评。
我相信每家公司应该都有一套自己的方法,只是不公开。而这个方法其实决定或者代表了这家公司希望自己的模型往哪个方向走。
在灵波,内部除了模型开发的评测,还有一个更直接的评测,就是商业落地。
我们一直持续把模型给合作伙伴用,并追问他们为了落地一个场景付出的成本是多少。我们希望的迭代效果是,发布 3.0 的时候能从合作伙伴那听到 " 比 2.0 的成本落地又少了 10 万元 "。这是我们在商业角度上最认可的一个评测基准。
让机器人具备类人的危机意识目前仍过于高阶
Q:如何看待具身落地的安全问题?
沈宇军:从今年年初开始,我在所有公开场合最后基本都会提一句,安全很重要。因为这件事情在落地时肯定是绕不开的。但是这个话题又非常大,而且很难,我一直希望学术界和科研机构能在这个方面提前做一些探索。
为什么这很难?因为人对安全的定义是很简单的,我们不想死,所以会害怕很多东西,这是刻在人类 DNA 里的。
但机器人没有这个问题,它们不怕死。从机器人目前的学习范式讲,只通过素材的方式,我们很难让它们辨别可能出现的安全问题。比如让机器人倒一杯茶,如果旁边有一根裸露的电线,还要不要倒呢?
如果这些场景可以被穷举,那就只是时间和成本的问题,但它现在不能被穷举。让机器人具备类人的危机意识是很高阶的智能,但要如何做,我也不知道。我觉得行业应该充分重视(安全)这个事情,重视到可能要为它提出很多新理论,或者发明新技术,而不是只停留在讲。
Q:如果为下一代机器人通用大脑制定一个标准,其中会有哪些维度?或者说,具身模型下一步要有怎样的提升才能算实现了本质的进步?
沈宇军:我自己有一个目标,就是如何评判我们的模型能做得比较好。
比如,有一天我们带上自己的机器人和模型来到这个会场,给它通上电,要保证它在跟会场所有人接触后,一整天不断片。
这一天中,别人让它做事情,失败或者成功都可以,只要能待满一整天不出问题,这可能是机器人可以开始谈论通用的前提。如果这件事情都做不到,机器人还只能呆在某一个特定或者封闭场景的话,我觉得离通用还很远。


登录后才可以发布评论哦
打开小程序可以发布评论哦