中经记者 郭阳琛 北京报道

此前,自变量机器人将物流分拣流水线搬上 WRC,现场实测分拣效率。受访者 / 图
不但可以做表演类动作,还可以完成拆快递、插花这类精细操作,支撑自变量机器人做到这一切的核心 " 大脑 ",原来是自研的 WALL-B 具身模型。
"WALL-B 的核心优势在于,它不是针对单一任务训练的专用模型,而是一套具备通用理解和决策能力的具身基础模型。" 不久前,自变量机器人相关负责人在接受《中国经营报》记者采访时表示,传统机器人往往依赖大量人工编写规则,而 WALL-B 通过将视觉、语言、动作和物理预测等能力融合在同一个模型中,使机器人能够理解环境、识别物体状态,并根据任务目标自主规划动作。
为进一步提升智能能力,8 月 27 日,自变量机器人正式发布 WALL-SS,即下一尺度自回归世界模型。据悉,WALL-SS 实现了三方面突破:预测锚定动作,生成的未来严格遵循动作指令;长时间稳定,推演较长时间仍能保持画面和物体状态连贯;可验证性,在虚拟世界验证的动作能够作为真实世界中的有效参考。
一个 " 大脑 " 应用多场景
在 2026 世界机器人大会(WRC)上,自变量机器人展示了行业内最 " 广 " 的家庭服务:机器人正有条不紊地完成家务劳动,包括整理柔软衣物、取外卖、拿饮料、收拾桌面、浇花、铲猫砂、自行充电等。有时还会拿起宠物玩具,逗一逗机器狗。
记者在现场看到,一双由 WALL-B 模型驱动的巧手拆开快递,取出风扇并拧开开关,为观众送去徐徐凉风;另一台人形机器人夹起观众指定颜色的花束,插在花瓶中递给观众。
上述自变量机器人相关负责人表示,家庭环境是目前具身智能最具挑战性的应用场景之一,因为它不像工业产线一样高度标准化。真实家庭环境会面临空间变化、物品摆放随机、任务流程更长等复杂情况。因此,机器人进入家庭后,需要持续在真实环境中运行和学习,而不是依靠一次性演示完成任务。
" 家庭环境的核心难点在于,要求机器人不仅完成动作还要理解人的需求,并在不断变化的环境中保持稳定表现。因此,通用模型能力的提升,是推动家庭机器人进一步普及的重要基础。短期来看,清洁整理、物品搬运、简单收纳等目标明确、任务流程相对清晰、用户需求高频的家庭服务任务更容易规模化落地。" 上述自变量机器人相关负责人阐释道。
物流分拣也是自变量机器人落地应用的主要场景之一。据悉,自变量机器人基于大模型 WALL-B,搭配稳定轻量的硬件双臂、夹爪、一体化支架,已经在真实运转的物流产线上完成了部署,实现超稳定的全无人化应用,简洁、可靠,可支持 7x24 小时不间断运行。
在这场既要 " 准确性 " 又要 " 速度 " 的考试中,WALL-B 模型展现出了较强的真实应变能力。据介绍,针对各类形态的快递盒,机器人能在半秒内完成空中翻面,精准利用重力和甩动实现落地角度控制,并同步规划后续动作;面对易形变的快递软包,机器人能实时感知变形并自我调整纠错;机器人甚至具备记忆能力,能在操作前通过夹爪摄像头往前方探查快递单位置,并能在传送带停滞时主动点触启动传送带。
记者了解到,家庭服务与物流分拣对机器人的能力要求截然不同。兼顾这两类应用场景,对具身模型的通用泛化能力提出了极高要求。
" 不同任务表面上差异很大,但背后的共同点是机器人都需要理解‘看到什么’‘应该做什么’‘动作之后会发生什么’。" 上述自变量机器人相关负责人表示,WALL-B 采用端到端的模型架构,将视觉感知、语言理解、动作生成以及物理预测统一起来,使机器人可以基于对环境的理解完成任务,而不是为每一个场景单独设计一套程序,这也是具身智能区别于传统自动化的重要方向。
" 未来,人工智能大模型仍将持续驱动具身智能无人系统迈向更高水平。" 机器人技术与智能控制专家、中国图象图形学学会理事长王耀南认为,多模态感知与端到端控制模型的泛化能力将得到进一步加强,从而显著提升系统在高度非结构化、动态开放环境中的适应性与生存能力。同时,融合模型预测控制、强化学习与仿生控制机制的新型智能控制框架,将有效增强系统在复杂动态场景中的行为泛化能力和抗干扰能力。
王耀南表示," 虚实协同 " 训练范式将得到更广泛应用,通过高保真物理仿真环境与世界模型技术,智能体可在虚拟空间中完成大规模预训练和策略优化,再通过真实世界数据进行快速微调,从而大幅提升任务执行效率并降低实体训练风险。
模型迭代实现三大突破
具身智能真正进入产业应用,需要模型、硬件和应用场景共同发展。目前来看,行业最大的挑战并不是单一技术环节,而是如何让机器人在真实环境中稳定完成任务,并具备商业化价值。
过去机器人能力提升更多依靠硬件升级,如今也加快了软件模型的迭代。8 月 27 日,自变量机器人正式发布 WALL-SS,即下一尺度自回归世界模型。它突破传统扩散模型以单片段生成视频的方式,创新采用 " 下一尺度自回归 " 架构:如同画家作画一般,先勾勒粗尺度轮廓,再逐层细化画面与物理细节,从而实现对未来画面更稳定、更精细的预测,实现了三方面突破。
首先,现有世界模型在预测未来状态时,往往高度依赖对背景和物体的先验模式,而对动作信号的细微变化不够敏感。以机械臂抓杯子为例,手指的位置相差 1 毫米,在物理世界中就可能对应 " 成功抓起 " 和 " 撞翻杯子 " 两种完全不同的结果。然而,由于两种情况在视觉上高度相似,模型很容易直接生成 " 稳稳抓住杯子 " 的虚假结果。
为此,WALL-SS 提出了 " 尺度对齐的动作条件注入 ":将机器人动作指令严格对齐到不同生成尺度中,让动作从生成画面的 " 辅助信号 " 变为必须遵循的核心条件。
世界模型面临的另一大挑战是,如何保持在长时间的稳定预测。模型需要连续生成未来的多个画面,而后续画面又建立在前面的预测基础上,因此任何细微的误差都会不断累积,最终导致预测崩溃。
据介绍,WALL-SS 提出了 " 尺度压缩的长时间跨度记忆 ":越近的记忆保留得越精细,越久远的则压缩为更粗粒度。比如,模型可以记住机器人几秒前 " 用左手抓住了杯子 ",几十秒前 " 移动到了桌子旁边 ",对于更久远的信息只需保留 " 场景中有桌子和杯子 " 这样的概括。如此一来,模型不论推演多久,内存占用始终恒定。
具身智能的发展与真实世界中的数据和应用场景密切相关。自变量机器人联合创始人兼 COO 杨倩表示,希望进一步推动亚太地区基础模型、数据方法、工具链和硬件接口的开放与兼容,探索透明、可复现的真实场景评测机制,同时加强青年人才培养、开发者交流和企业实践,让更多中小企业和年轻人参与具身智能发展。同时,通过开源降低技术门槛、通过真实场景推动技术迭代、通过区域合作共享创新成果,为中小企业数智化转型提供新的技术支撑。
记者了解到,世界模型面临的第三个关键问题是:在虚拟世界里验证成功的动作策略,到了真实世界里是否依然有效。对此,WALL-SS 提出了 " 视觉动力学的在线策略对齐 ":让模型在自己预测的轨迹上通过强化学习 " 实战练习 ",并根据两个裁判的反馈不断修正,一个检查 " 动作对不对 ",另一个检查 " 长期一致性 "。
" 我们认为,未来机器人竞争的关键会逐渐从‘硬件堆叠’转向‘智能能力提升’。" 上述自变量机器人相关负责人表示,更强的具身模型可以帮助机器人理解环境、适应任务,让更成熟、更可靠的硬件完成更加复杂的工作。从物流分拣到家庭服务,自变量机器人正在探索的路径是通过通用具身模型能力,让机器人从单一任务执行走向多场景应用,推动具身智能从展示阶段进入真实应用阶段。
(编辑:石英婧 审核:童海华 校对:刘军)


登录后才可以发布评论哦
打开小程序可以发布评论哦