作者|苏涵机器人赛场从来不缺冠军。会跑步、会踢球、会打拳、会跳舞,伴随着具身智能热潮升温,机器人能够完成的动作越来越复杂,一场场比赛也变得越来越热闹。但在这些看起来繁花似锦的冠军背后,一个更现实的问题始终没有消失。机器人最终要成为一种生产力,比起跑得多快、球踢得多好,更重要的或许是——离开人的控制,它到底能不能自己干活?最近举办的第二届世界人形机器人运动会,就提供了一次难得的公开检验。相比跑步、打球等更具观赏性的项目,餐饮制售、办公服务并不起眼,却可能更接近机器人的未来。尤其是办公赛,机器人需要完成取纸、打印、碎纸、布置会议桌等一系列连续任务,涉及矿泉水、桌签、会议本、柔软纸张等不同物品。其中一些操作,对今天的机器人依然称得上棘手。面对这样一套复杂的连续任务,其他参赛队伍均采用遥控操作,由人工参与机器人的实时控制,千寻智能则成为办公赛决赛中唯一一家全程依靠模型 100% 全自主推理参赛的企业。最终,千寻丝滑流畅完成比赛,一举在办公赛夺冠;另一边,在同样强调真实任务执行的餐饮赛决赛中,千寻也拿到高分,获得亚军。这是千寻第一次参加世界人形机器人运动会。首次参赛,只选择餐饮和办公两个场景,却在全部采用全自主推理的情况下拿下一冠一亚,也让这张成绩单显得更加难得。如果把遥控操作理解成一场「开卷考试」,人工可以在机器人遇到变化时及时介入和调整,那么全自主推理更像是一场真正的「闭卷考试」。千寻成为办公赛决赛唯一选择「闭卷答题」并拿下冠军的企业。这也让冠军的含金量有了另一层解释。某种程度上,当比赛开始真正检验具身智能的成色,「人海战术」也好,参赛项目数量也罢,都已经不是最值得关注的指标。真正困难的是,在一个足够复杂、充满变化的真实任务里,机器人能不能摆脱人的实时控制,独立把一件事情从头做到尾。当机器人行业逐渐从「看起来很聪明」走向「证明自己真的聪明」,真正稀缺的也不再只是又一个会跑、会跳、会打球的冠军,而是一个能够自己把工作做完的机器人。毕竟,比赛终究会结束。能不能真正上班,才是一场更漫长的比赛。当 Demo 越来越多,全自主才是真考题如果把时间往前拨几年,机器人能够稳定跑起来、抓起一个物体,甚至叠好一件衣服,本身就是值得讨论的技术突破。那时的具身智能首先需要回答一个最基础的问题:机器人到底「能不能做到」?但到了今天,越来越多机器人已经能够做出足够惊艳的 Demo。技术进步当然值得肯定,但当「会做」逐渐成为行业标配,这些能力究竟有多少能够离开展台,真正进入现实世界。这也是为什么,相比跑步、打球等更容易制造传播效果的项目,这届机器人运动会里的餐饮制售、办公服务等场景赛,反而更值得关注。因为现实世界里的工作,很少只是完成一个动作,有些难点甚至藏在最普通的物品里。比如一张纸。对人来说,拿起一张纸几乎不需要思考,但对机器人来说,纸张柔软、容易弯折,抓取之后形态随时可能发生变化,视觉条件也会随之改变。模型需要不断判断纸张当前的位置和状态,再调整接下来的动作。这种难度,其实从预赛阶段就已经体现出来。办公场景综合服务岗预赛中,千寻的两支队伍全部选择自主推理,并直接包揽前两名。一个很有意思的细节是,在官方成绩表的「权重系数」一栏,排名第一、第二的千寻智能和 Spirit-AI 都是 1.0,对应推理模式;从第三名开始,其余晋级队伍则全部变成 0.5,对应遥控操作。但不是没有其他队伍尝试过自主推理。成绩表中,后面同样出现了多支系数为 1.0 的队伍,但最终没有拿到有效任务分,甚至直接弃权。换句话说,自主推理不是一道「选择题」,而是一道「能力题」,很多队伍都可以选择做出这个选择,但真正能够靠模型把比赛完成的,只有千寻。决赛中,千寻成了唯一一家 100% 坚持模型推理参赛的企业,且一举夺魁。这对机器人的要求已经不止于「手脚灵活」,还需要真正理解任务:现在应该做什么,下一步应该做什么;如果物品的位置发生变化怎么办;如果抓取失败,是继续执行原来的动作,还是重新判断、重新规划?这也是全自主推理与遥操、预设流程之间最大的不同。人工只需要告诉机器人最终要完成什么,剩下的环境感知、任务理解、动作规划和执行,都交给具身大脑自己完成。面对意外情况,机器人还要重新判断并继续工作。从这个角度来看,机器人运动会的意义也正在发生变化。相比企业实验室里可以反复调试、精心设计环境的 Demo,公开比赛提供了一套相对统一的规则和任务。不同公司的机器人站到同一个「考场」里,究竟是依靠人工控制,还是依靠模型自主完成;只能完成一个动作,还是能够连续解决整套任务,差异开始变得更加直观。当具身智能开始走向生产力,这或许才是真正重要的考题。同一个「具身大脑」,如何跨过两个不同考场?在这次运动会上,千寻依靠同一套具身大脑,在办公、餐饮两个完全不同的场景中分别拿到冠亚军。相比奖牌本身,这两个项目更值得讨论的地方,在于它们提供了一次跨场景验证。物品换了、环境变了,甚至机器人本体发生变化,原本有效的能力都有可能失效。千寻想要解决的,是让一套模型能够适应更多任务和环境。这种能力首先来自数据。相比大语言模型可以从互联网获得海量文本,机器人需要学习的是人如何与真实世界打交道。杯子怎么抓、抽屉怎么拉、不同形状的物体应该如何操作,这些知识都需要大量真实的交互数据。传统的做法,是让人远程控制机器人完成任务,再把过程记录下来给模型学习。这类数据质量很高,但采集速度慢、成本也高。千寻因此建立了一套「数据金字塔」:底层是大量的互联网视频,让模型先认识这个世界;中间通过第一人称视角数据 Ego-Centric 以及自研可穿戴设备 uDAS,记录真人收拾床铺、清洗水槽、打包纸箱等真实操作;最上层再加入质量更高的遥操作数据,让模型适应具体机器人。自研 uDAS 目前已经迭代七代,积累超过 20 万小时真实数据。按照千寻公布的数据,它采集的数据有效性可以达到传统遥操作的 95%,成本却只有约 1/10。这背后的逻辑并不复杂:先让机器人尽可能多地「见世面」,再针对具体工作进行训练。但见得多,只解决了「有没有经验」的问题。真正进入现实世界,机器人还要面对大量训练时没有标准答案的情况。千寻过去一段时间的多项研究能力,很多都是从这些实际问题倒推出来的。比如,换一种机器人,原来学会的东西还能不能用?举个例子,双臂和单臂机器人即便完成同一个拿水杯的动作,身体结构、摄像头位置和运动方式也不一样。但千寻通过跨机器人本体对齐,让不同「身体」之间共享已经学到的经验。实验中,千寻双臂机器人 Moz-1 学到的动作迁移到单臂机械臂 Franka 后,成功率从 36.7% 提升至 76.7%;反向迁移则从 30% 提升至 85%。再比如,人类说话不会永远像写操作说明书一样准确。日常生活中,人很少会准确地说「拿起左边第二个水杯」,更多时候只是随手一指:「把那瓶水给我。」而千寻的视觉指向理解技术 Point-VLA 做的,就是让机器人把语言和眼前看到的东西结合起来,判断人究竟指的是哪一个物体。环境变化同样会带来麻烦。机器人在训练时记住了一张桌子的高度、一个杯子的位置,真正工作时桌子变高、杯子被挪走,它仍可能机械地重复原来的动作,甚至抓空之后继续执行。千寻提出的减少本体状态依赖的 State-free Policy,针对的就是这种「背答案」现象,让机器人更多根据当前看到的环境做决定。还有,机器人进行长任务时,经常会遇到动作容易犹豫、卡顿的情况,模型需要不断判断下一步怎么做,前后衔接不好,就可能出现伸手、停顿、突然纠正的情况。针对这一问题,千寻通过延迟感知动作策略 Legato,减少这种推理延迟带来的影响。以倒水任务为例,其完成时间从 95.07 秒大幅缩短至 75.73 秒。上述提到的换身体、听懂人话、适应环境变化、减少动作卡顿,这些看起来是四个不同的问题,但背后指向的却是同一件事:机器人需要在环境、任务甚至身体发生变化之后,依然能够根据眼前的情况继续解决问题。这也是泛化能力最直观的体现。为了让这种能力持续进化,千寻还把数据采集、模型训练和真实部署连接成了一套持续循环的系统。各地采集的数据经过清洗和处理,最快第二天就能用于新一轮训练;更新后的模型重新部署到机器人,真实工作中遇到的新问题又继续回到训练体系。这就相当于机器人的「工作复盘」:不断工作、遇到问题、回来学习,再重新工作。从拿冠军到能「上班」,机器人开始比拼生产力拿下冠军之后,机器人下一步要去哪里?答案可能不在下一个赛场,而在工厂、商场和办公室。机器人今天在餐饮场景取物、操作设备,明天进入办公室寻找文件、整理物品,未来还可能进入工厂和商服场景。岗位不断变化,底层的大脑却可以继续复用。千寻此前围绕跨机器人能力迁移进行研究,也是出于类似的考虑。这是「通用具身大脑」真正具有产业价值的地方:它最终需要被复制的,不是一套固定动作,而是一套解决问题的能力。当然,从「会干活」到真正成为生产力,中间还有一道更高的门槛——稳定性和规模化。机器人偶尔成功一次并不难。真正进入生产流程之后,同一个任务可能一天需要执行几十次、几百次。物品会被移动,环境会发生变化,执行过程中也随时可能出现意外。一次漂亮的成功 Demo,在这里没有太大意义。千寻选择 100% 全自主推理,从预赛到决赛一路稳定发挥,也因此有了另一层价值。两个复杂场景中,机器人背后都没有人实时告诉它下一步应该怎么做。任务理解、环境判断、动作规划和执行,都交给模型自己完成。这件事直接关系到机器人未来的规模化成本。十台机器人背后分别站着十个人,技术上依然可以完成工作;当部署规模扩大到 1000 台、10000 台,人力却很难按照同样比例增长。机器人想成为一种真正可复制的生产力,人工的实时介入必须越来越少。因此,「全自主」不只是一个技术标签,也是一笔经济账,这也是通用具身大脑真正具有产业价值的地方。另外,千寻在数据端建立的持续学习体系,同样服务于这个目标。机器人进入真实环境工作,遇到的新问题重新回到训练体系,模型更新之后再回到机器人身上。这种「工作复盘」的能力,放到产业层面来看,本质上是在建立一种可以持续提升成功率和稳定性的能力。于是,千寻这次比赛中的几个关键词:同一模型、跨场景、100% 全自主推理——恰好对应了未来机器人生产力的几个重要指标:能不能自己干,换个岗位还能不能干,遇到变化还能不能干,以及能不能持续把事情干好。当不同公司的机器人进入相对统一的公开场景,谁需要遥操、谁能够自主完成;谁擅长单点动作、谁能够执行连续任务;谁换一个场景还能继续工作;这些问题,都开始拥有更加直观的答案。具身智能也终于有机会「不看广告,看疗效」。因此,从这个角度再看千寻在两场比赛拿下的冠亚军,价值也不止于此。机器人会跑马拉松、会打网球、会跳舞,当然代表着运动控制能力的进步。但具身智能真正走向产业,最终还是要回到那些看起来并不炫酷的普通工作中来。千寻在餐饮和办公两个「岗位」上完成的,只是一次公开验证。未来还需要面对更多场景、更长时间、更复杂环境的考验。但至少这一次,两支队伍、同一个大脑、两个不同岗位、100% 全自主、比赛中唯一一个全程依靠模型推理参赛并最终夺冠的企业,已经给出了一张足够有分量的答卷。比赛终究只是考试。真正的下一场比赛,是让机器人去上班。


登录后才可以发布评论哦
打开小程序可以发布评论哦