(来源:定焦 One)
人形不再独占 C 位,大脑内卷,数据为王。
定焦 One(dingjiaoone)原创
作者 | 王璐
编辑 | 魏佳
这几天,科技圈的最大盛事当属 WAIC 大会。今年,人气最旺的是上海世博展览馆 H3 馆,具身智能首次独立成馆,与智算并列为大会两大核心赛道,从整机到灵巧手、关节模组、传感器,一条产业链完整铺开。
「定焦 One」连续两天走访,在现场最直接的感受是 " 人多 "。宇树展台被围得挤不进去,加速进化把展位改成小型足球场,一群不到 1 米高的机器人自己踢球、抢断,还会假动作。根据官方披露的信息,今年参展的具身智能企业从去年的 80 多家增加到 200 多家,真机超过 300 台,且几乎全部动态运行,而去年这里还以静态展示为主。
除了观众们的热情之外,还有一个明显的变化是机器人可以干的事情变了。去年是 150 台人形同台,卷的是后空翻、做咖啡这类炫技动作,今年各家的 demo 从炫技换成了做早餐、打蝴蝶结、进汽车产线这类更杂、更难也更贴近真实场景的任务,机器人的形态也从单一的人形变得更加丰富。
不过热闹之下,行业仍处在早期:大脑架构未定、训练机器人的数据从哪儿来还是难题。H3 馆里几乎每家都在讲 " 我家模型最懂物理世界 "," 机器人该用 VLA 还是世界模型 " 的争论被直接搬上论坛。
这些问题没有标准答案,而 WAIC 恰好是观察各家给出什么解法的一个窗口。本文从形态、大脑、落地三个维度切入,看看今年具身智能走到了哪一步。
进入 H3 场馆,科幻电影里的场景似乎没那么远了。几台机器人排成一列缓缓穿过通道,偶尔有观众侧身让路,当你饿了的时候,可以去某个展台 " 领 " 一份由机器人完成的早餐,虽然动作还有点僵硬迟缓,但至少是真的能吃。
「定焦 One」在馆里逛了大半天,一个强烈的感受是,人形机器人依然是重点,但不再独占 C 位。去年是 150 台人形同台、卷自由度、卷后空翻,今年人形还在,但载人机甲、可变形本体、半人马等新形态纷纷涌现,轮式和四足这些成熟形态也找到了更明确的场景。
按落地场景看,各家大致分成了三派。
第一派是工业务实派,既有轮式,也有双足,形态让位于稳定。
智元拿下 H3 馆最大展区,集中发布五款产品,其中轮式的精灵 G2Max 主打 " 安规级重载 ",能 24 小时不间断搬运码垛,无需人工轮岗、夜班值守,直接瞄准仓库 " 两班倒 " 的人力缺口。
同样瞄准工业,它石智航给出的是另一套答案,它把一条 1:1 复刻的汽车线束产线搬进展台,由 " 轮式底盘 + 双臂 " 的机器人集群现场演示产线自主作业。工业场景下,这种组合比较务实,能连续作业、能灵活调度,成本和稳定性都适合量产爬坡。
智元机器人 图源 / 智元官网
乐聚这届不再讲商超和家庭,转而聚焦工厂,其全尺寸人形机器人夸父系列(含双足版与轮式夸父 5-W)与蚂蚁灵波合作实现物流全场景自动化,涵盖纸箱拆垛、搬运、上料等环节。
第二派是小人形,把人形机器人做小,用价格换入场券。
松延动力身高不到一米的小布米定价 9998 元,是目前市面上第一款万元以内的量产人形机器人,高约 94 厘米、约 12 公斤,已正式开售。作为参照,一台全尺寸人形通常在 1.7 米上下、几十万元起,小布米几乎把体型和价格同时砍掉一个数量级。展台上,小布米们同步完成舞蹈,动作对齐精准,OTA3.0 功能支持用户通过手机 App 远程更新机器人的交互界面、动作姿态和内容。
消费级小人形的玩家还有鹿明机器人,现场展示了 AI 迷你双足人形 " 鹿小明 ",仅 89 厘米,可跟随音乐起舞。加速进化则把展台变成小型足球场,一批身高不到 1 米的机器人自主踢球、非遥操,射门力道猛还会假动作,走的是科研、竞技路线。
加速进化机器人踢足球 图源 / 「定焦 One」摄
第三派是新形态探索派,按环境切换形态。
宇树科技依然有人形拳击赛,但站 C 位的是 GD01,这是一款载人变形机甲,人可以坐进座舱操控,其定位为 " 民用交通工具 ",号称全球首款量产版载人机甲,但起售价高达 390 万元。上纬启元 T1 在轮足人形和四足之间自主切换,室内走轮足,安静、零转弯半径,客厅书房都能,到户外切换四足,过草地、砂石、斜坡、台阶,对应散步、露营场景,其变换形态被网友调侃 " 人模狗样 "。
逐际动力 TRON2 走模块化路线,像拼乐高一样组合成双足、双轮足、双臂,现场甚至还用双足加双臂拼出一只 " 半人马 " 形态,不仅能背负 30KG 稳步走,还能在地毯上拖轮胎,对应商用服务场景的复杂地形。
逐际动力半人马 图源 / 逐际动力官网
整体看下来,今年机器人的形态比去年更加丰富,但逻辑一致,即按场景反推本体。一位具身智能从业者表示,凭借一款本体打天下的幻觉被订单砸碎了," 工业要轮式、家庭要人形、消费要小巧、特种要载重机甲,每家都在按场景反推本体,形态自然就被打散了。"
不过,形态变多说明厂商们把场景想清楚了,不代表活儿真干好了。展会上看到的搬运、踢球、舞蹈,多数还是在可控的环境里 " 演 " 出来的。选对形态只是拿到了入场券,能不能把活儿干利索,还得看大脑和手脚跟不跟得上。
形态是肉眼能看到的变化,更大的比拼发生在看不见的地方——机器人的大脑。
先简单科普下背景。具身智能这两年主要用 VLA(视觉 - 语言 - 动作)模型,它擅长看懂场景、听懂指令,但对物理世界缺乏真正理解,一遇到没见过的场景,泛化能力(把学过的本事迁移到新场景的能力)就明显打折,往往在实验室里表现很好,一进真实家庭就崩。于是各家开始探索新的方向," 世界模型 " 成为今年最热的选项。通俗来说,世界模型是让机器人先在 " 脑内 " 预测 " 这么做世界会变成什么样 ",再决定动作,而不是死记硬背动作顺序。
从现场来看,各家的押注集中在两个方向:长程任务和复杂操作。
长程任务方面,银河通用的星脑模型把任务长度从去年的短动作延长到了 3 – 5 分钟。现场演示中,机器人连续完成烤面包、倒饮料、取盘装盘,即使工作人员临时挪动杯子或餐盘,它也会重新扫描桌面寻找目标,而不是按固定点位执行。
更为极限的是原力灵机联合阶跃星辰发起的挑战,6 台机器人用原力灵机的通用具身基础模型 DM0.5,连续协同拼装一座 8 万余块积木的长城,实现了 15 小时的持续作业。
复杂操作方面,星尘智能一口气放出 22 项真机家庭任务,包括煎蛋颠锅、称小米、打蝴蝶结等高难度操作,是本届 WAIC 家庭场景 demo 最全面的一家。
星尘智能机器人协作叠纸箱 图源 / 星尘智能官网
在这些能力提升的背后,各家在世界模型上走出了不同解法。
银河通用在大会期间发布的 WAM-TTT,解决的是 " 进场快 "。TTT 即 " 测试时训练 ",可大致理解为,基础技能先预训练好,机器人进了客户现场,只需看一批人类操作视频,就能适应新环境干活,不需要动作标注,预训练参数也完全冻结。
按其论文中的对照实验,100 条机器人轨迹搭配 100 条人类视频,成功率 74.1%,与 200 条纯机器人轨迹的 73.7% 基本持平,这意味着便宜易得的人类视频,大致能替代同等数量的真机数据,比如原本需要 100 小时数据训练的新任务,现在可能只要 2 小时就能跑起来。创始人王鹤打了个比方," 厨师换厨房,厨艺不变。"
但一位从业者指出,这一方式想冲到 99% 的落地标准,仍离不开大量领域专用数据,想 " 干得好 " 还要训练。
星尘智能在 WAIC 前夜发布的 Lumo-2,解答的是 " 怎么想 "。它号称业界首个 " 家庭隐式世界动作模型 "。
星尘智能副总裁王佳楠用煎蛋的动作,来解释这条 " 隐式 " 路线具体如何工作。模型接到指令后,不会直接调用现成的动作,而是在内部先 " 想象 " 一遍," 蛋在锅中间不好颠,状态应该变成靠近锅边 ";再推理动作," 手往下压一点,让蛋滑过去 "。这和传统的 VLA 模型不同,VLA 更像是 " 背动作 ",记住以前做过什么,遇到类似情况就照着来,Lumo-2 是 " 为了达到某个效果,自己想办法生成动作 ",所以环境一变,它也能灵活调整。
但该路线也有两大难点。第一,它不生成画面,你看不到它脑子里在想什么,就像一台黑盒子,只能看它最后干得好不好,没法中途检查它想得对不对。第二,摄像头拍到的东西可能不足以区分当前状况,比如同样是桌上一只杯子,里面有没有水、水是满的还是半满的,从画面看几乎一样,但机器人该用的动作完全不同。这种隐式路线的优点是省算力、能自主运行、能切换场景,代价是内部过程看不见,出了问题不好排查,训练也更费劲。
腾讯则在 WAIC 期间发布了 RxBrain,解决的是 " 推理和想象怎么统一 "。它是腾讯 Hy-Embodied 系列里的 " 大脑 " 模型,腾讯首席科学家张正友用 " 裂脑 " 比喻来解释其架构:去年左右脑之间仅通过语言连接,今年 RxBrain 在左右脑之间增加了视觉信息通道,一边用文字描述子任务,一边用图像展示完成子任务后世界会变成什么样。
他并没有直接给这个模型贴上 " 世界模型 " 的标签,但他认为,这已经踩进了世界模型的方向,既能够做推理,同时有想象力。在他看来,世界模型目前还没有一个统一的技术方案,各家都在摸索,腾讯也不例外。
把这几条路线摆在一起,会发现 VLA 和世界模型并非二选一的关系。VLA 在持续进化,世界模型也在吸收 VLA 的经验,两条路线同步往前走。
在 WAIC 现场,大家问得最多的问题是:机器人为什么还进不了家、进不了厂?卡点集中在两处,喂给大脑的数据不够多,以及执行动作的那只手还不够灵。
先说数据。世界模型虽然缓解了部分数据压力,把 " 理解世界 " 这部分从遥操转移到了视频,但行业才刚起步,各家路线五花八门,无论走哪条路,高质量的真实数据都是绕不开的共同刚需。
图源 / 「定焦 One」摄
本届 WAIC 上,数据采集第一次成了一个独立品类,多家公司带着专门的数采设备和方案出现。目前能看到三种思路并存。
第一种是本体厂自采,数据长在自家机器人本体上,宇树、乐聚都在做,好处是 " 采什么练什么 ",但数据多封闭在自家体系内。
第二种是出售数采设备,相当于 " 卖铲子 "。
觅蜂科技(智元孵化)的 MEgo 系列走的就是这条路,核心是 " 不绑机器人 ",用轻便的硬件就能采数据。它的客户主要是两类,一类是缺乏本体或不想绑本体的具身初创公司,另一类是本体厂想补一套更灵活的数采手段。
其操作也不需要机器人工程师,普通数据采集员戴上就能开始采集数据。MEgo Gripper 是一个手持设备,重量为 560 克,像拿个加大号游戏手柄,能记录毫米级的空间轨迹,MEgo View 是穿戴套装,头上戴全景相机、手腕上绑摄像头,7 路画面同步录制,一个人可把 " 如何操作 " 的全过程采下来。
第三种是 " 数采 + 世界模型 " 打包卖。大晓机器人在 WAIC 上同时发布了 ACE 数采设备和开悟世界模型 KAIROS。ACE 采回来的数据格式直接和 KAIROS 对接,客户不用再转格式、清洗数据,拿来就能用。当然,也可以只买模型或只买采集设备,不强制捆绑。
三种思路背后是竞争的白热化,2026 年被反复称作 " 具身数据元年 ",谁把标准化、低成本的数据供给跑通,谁就占住了产业链上最难替代的位置。
说完大脑,再来看 " 手 "。如果说数据是 " 大脑的食物 ",那灵巧手就是 " 大脑的手 ",末端不够灵活,再好的模型也发挥不出作用。
前两年,行业的目光大多在跑、跳、翻这些大动作上,今年重点从 " 腿 " 转到了 " 手 "。背后也有行业背景,直驱关节的单指成本大幅下降,触觉传感的精度和价格双双跨过量产临界点,把灵巧手从过去的工业夹爪,推到了具身智能的核心终端位置。但怎么做一只好手,行业还没有共识,今年 WAIC 上,灵巧手的路线也是多种多样。
灵心巧手一次性把连杆、腱绳、直驱三种技术路线的灵巧手都摆了出来,其中最受关注的 O30 是全直驱方案,即电机转子直接连接关节负载,中间没有任何减速装置,好处是力控更直接、更精准,代价是电机发热更大。O30 有 20 个关节独立活动,重量 740 克,定位精度亚毫米级,额定负载 30 公斤,对应汽车精密装配这类高精度场景。
超维动力的 KAIHand 追求的是手指灵活度,有 37 个关节,尺寸和真人手一样大,指尖力气超过 30 牛,整只手 80% 的面积覆盖了触觉皮肤,能感知 0.1 牛的微小力度。现场还演示了用 KAIHand 砸木板,证明它既结实又有韧性。
整体来看,今年 WAIC 的具身智能确实往前走了一大步,本体根据场景划分成不同形态,任务时长从秒级拉到分钟甚至小时级;操作也从简单抓取,升级为复杂的打结、进产线,各家都在从 " 能演 " 转向 " 能干 "。
不过,这个行业还处在探索期。正如现场一位具身智能创业者对「定焦 One」感叹,今年技能层面的进化并没有超过他的想象,真正丝滑的还是跳舞、迎宾这类简单场景;零售、物流、工业离可用还很远,离家庭服务更远。
WAIC 的热闹总会散场,聚光灯之外,具身智能这个新兴赛道,还得继续打拼很多年。
* 题图由「定焦 One」拍摄。


登录后才可以发布评论哦
打开小程序可以发布评论哦