智东西 昨天
具身开始拼落地:首家集齐「6 颗商业化宝石」的公司出现了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 许丽思

编辑 | 漠影

今年年初,不少具身智能企业可能还忙于拼 benchmark,各大榜单第一隔几天就刷新一回,模型能力进步飞速。

但进入下半年,你会发现,大家好像没那么在意这些榜单了,而是收束技术能力、聚焦让机器人真正能用,狂卷落地干各种脏活的能力,行业的关注点正在加速向商业交付靠拢。

这印证了一个判断:真正的壁垒,藏在那些没法开源的部署 Know-how 里。

具身智能落地前的 " 最后一公里 ",需要跨过三道关卡:

模型走出实验室,要能适应光照变化、物料堆叠等现场干扰;生成动作后,系统还得处理时延、动作衔接和安全问题,让机器人稳定执行;一个工位跑通后,更要把现场经验沉淀为可复用的技能和部署工具,减少更换机器人、工位和工厂时的重复开发,推动单点项目走向规模复制。

而安努智能这家公司的特殊之处就在于,从成立之初,便将商业化落地作为核心目标,专攻 " 部署模型 + 垂类模型 " 这一最被低估、却决定商业化生死的环节,将真实工厂订单视为商业化的重要检验标准。沿着这条路径,现场遇到的问题逐渐进入其产品设计,推动团队同时补齐数据、模型和部署环节的能力。

最近,安努密集发布了 6 项重大成果:

Helios本质是一套实时长视频生成技术体系,最初并不是面向具身智能设计,但其攻克的长时序建模、实时生成、高效历史状态维护等技术难点,恰好击中具身智能与世界模型的核心痛点,且已被高德 ABot-World、极佳视界等团队作为基础模型应用于各自的世界模型中。

ANU SimLab则是专门面向软物体操作打造的仿真平台,集成自研软体与热学双求解器、Isaac Sim 合成数据工厂及经真机验证的 sim2real 方法,打通物理方程——合成数据——真机部署全链路。整套方案落地门槛低,配套的数据、模型与验证方法均可复用。软包裹抓取、热视觉数据生成、仿真到真机迁移这三项核心能力,已经完成工业项目验收。

Helios 和 SimLab 负责低成本、大规模生成合成数据,为上层模型持续输送训练 " 养料 "。

ActiWorld聚焦动作导向动力学,让机器人 " 预见 " 未来。其通过逆动力学头与运动门控,精准捕捉交互变化,卡位具身操作最务实的一环——提前预判动作成败。这正是工业垂直场景最需要的 " 想象结果检验 " 能力。

预演之后,RoHIL 与 EvoHIL作为两代真机强化学习技术,提升机器人对实际环境的适应能力。EvoHIL,把机器人从 " 人工盯训 " 推向上线后自主进化。自演化奖励模型 SER,避免环境变化带来奖励漂移;AFS 动作流稳定模块,减少抖动与机械损耗;继承并升级世界模型重光照 + 锚定正则机制,大幅降低光照偏移下人工干预率。

总体来讲,RoHIL 解决换工位的迁移成本,EvoHIL 解决产线长期运行的运维负担,在相关任务中方案可以30 分钟训练达到满分成功率跨光照 0 重踩并把工业机器人部署成本砍掉 80%

到了执行环节,AnuVerse-0.5由世界模型蒸馏出的垂类小模型(MoT 架构、百毫秒推理、单卡桌面部署),它是直接装在产线边缘端的 " 大脑 ",负责把上层的泛化能力压缩成极速响应的具体指令。

最上层的端到端模型部署系统 Nexus负责把这些分散能力组织起来。它通过统一接口缩短模型接入机器人的时间,根据任务调度不同模型和技能,并将模型、本体和算力资源汇聚到同一套部署系统中,从而实现快速部署、自主调度和资源汇聚。

这些成果,覆盖视频生成与仿真、动作预测世界模型、真机强化学习、垂直小模型和端到端部署系统,形成了从 " 数据生成 - 模型预测 - 学习进化 - 部署落地 - 数据回流 " 的全栈闭环。

接下来,我们详细拆解下ActiWorld、AnuVerse-0.5 和 Nexus 三项核心成果,可以进一步看清安努如何处理机器人落地中的关键难题:先让它判断得更准确,再把判断及时转化为动作,最终走向能够持续运行、反复复制的工业应用。

一、干活之前,机器人得先在脑子里进行准确预判

假如,机器人要分拣一个包裹,视频世界模型就会提前生成了伸手、抓取、放置的逼真画面。不过经常会出现一个问题,那就是视频很流畅、生成效果很像,夹爪却没法在正确位置接触包裹,这段 " 想象 " 就可能误导后续决策。

问题藏在训练目标里。机器人操作视频的大部分像素属于桌面、墙面等静态背景,真正决定成败夹爪或灵巧手与包裹的接触和位移只发生在很小的区域。

统一计算损失的时候,模型很容易只依赖当前画面与视频先验,弱化对输入动作的使用。夹爪偏一点、物体少移动一点,就很容易被掩盖,这些误差还会不断累积。

安努研发团队的反事实测试直观揭示了这一点:固定当前观测与生成噪声,只把动作替换成方向相反、全零或时序打乱的动作,一些模型仍会沿原有轨迹生成。这说明模型学到 " 画面接下来通常怎么变 ",却没学会 " 给定这个动作,世界应该怎么变 "。

1、从动作、时间和空间入手,让预测跟着动作走

安努这次发布的动作锚定的世界模型 ActiWorld,就把 " 动作条件生成 " 升级为 " 动作锚定的世界动力学 "。

ActiWorld 的核心出发点,把 " 动作条件生成 " 升级为 " 动作锚定的世界动力学 "

具体来说,ActiWorld 在三大层面实现了突破:

动作层面:ActiWorld 引入轻量级逆动力学头,从相邻的预测潜变量中恢复对应动作,直接约束 " 这个状态变化是否真的是该动作造成的 "。

时间层面:围绕当前观测同时学习过去和未来,从而更准确地理解运动方向、接触过程和物体状态,改善部分可观测条件下的长程预测。

空间层面:强化学习夹爪、接触物体等真正发生变化的区域,同时抑制背景漂移,让关键物体按照动作正确变化。

ActiWorld 在动作条件扩散骨干上加入三项训练约束,这些辅助模块只在训练阶段使用。

2、预演之后,怎样选动作、做规划?

预测更准确,还要能帮助机器人作出选择。

在安努的真机实验中,ACoT 负责提出候选动作,ActiWorld 分别预演后果,CA3C 负责进行比较,决定执行哪组动作、执行多长。整个过程中,ACoT 参数保持冻结,无需重新训练。

为公平比较,ActiWorld 在相同的当前观测和生成噪声下进行预演,使预测差异主要来自动作本身。CA3C 关注的是这些动作会带来怎样的状态变化,避免仅凭动作数值相似或未经验证的成功概率作判断。

具体来说,CA3C 将多组预测仍较为一致的区间视为相对可信的范围,从中选择最接近共同趋势的候选动作。预测持续一致时,可以连续执行较长片段;一旦结果明显分叉,就提前结束当前片段,依据新的真实观测重新规划。在接触、抓取、放置等高风险阶段,系统也会缩短执行长度,减少误差累积。

3、完成 AgiBot G2 真机验证,成功率提升 6 个百分点

AgiBot G2 真机预测示例。绿色为初始真实帧,橙色为 ActiWorld 预测帧,蓝色为实际执行后的未来真实帧。

原始 ACoT 的成功率为 56.0%;加入 ActiWorld 引导的 chunk planning 后提升至 62.0% ——成功率绝对提升 6 个百分点、相对提升约 10.7%,相对失败率下降约 13.6%。

这意味着,每 1000 次作业可多完成约 60 次成功分拣,相应减少人工干预、重复抓取与异常处理。

更关键的是,这一结果是在小规模真机数据和原有 ACoT 策略保持冻结的条件下取得的,说明增益主要来自世界模型对动作后果的预演与决策增强,而不是通过重新训练基础策略换来的—— ActiWorld 是推理阶段 " 即插即用 " 的决策增强模块。

机器人只有先把每一步的后果想清楚,才能减少真机试错,让每一次行动多一分确定性。

与其他头部具身智能世界模型不同,ActiWorld 是少有的不绑定本体、专攻 " 动作后果验证 " 的轻量中间件。它不触碰策略层,逆动力学头、双向预测、运动门控三项约束仅在训练阶段生效,推理时零额外开销,核心能力全部聚焦在 " 动作可恢复、局部残差更小、可预判策略成败 " 上,可作为实时 " 预演参谋 " 接入任意本体,把动作的连锁后果算得清、兜得住。

ActiWorld 与头部本体厂商的基座世界模型并非竞品,而是嵌套协作关系。基座模型搭建物理自洽、支持大规模试错的通用虚拟母体,追求覆盖广度与物理一致性;但对工业产线而言,真正的核心诉求从来不是虚拟世界有多大,而是动作执行有多准。

ActiWorld 恰好补上这一缺口:在基座的预测帧之上增加 " 动作 – 状态 " 一致性校验,过滤掉 " 画面逼真但对动作不敏感 " 的幻觉问题,将可靠的预测结果输出给强化学习与端侧小模型,最终经 Nexus 部署落地到产线。

简单来说,基座回答 " 世界大概会怎么变 ",ActiWorld 回答 " 做这个动作具体会怎样 "。前者撑起通用广度,后者深耕工业精度,二者在安努的数据回流与部署闭环中形成互补。

二、百毫秒级推理,把机器人脑中预判变成丝滑的真实动作

机器人能预判动作后果之后,还要回答一个更紧迫的问题:现场会留给它多少反应时间?

一直以来,世界动作模型面临着一个 " 不可能三角 " 的问题,那就是模型规模、推理速度与部署成本难以兼顾。

模型越复杂,对世界的理解可能越充分,但通常需要付出更高的计算成本和更长的推理时间。而工业机器人在干活的时候,需要持续响应环境变化,时延过长会造成动作卡顿、本体抖动,并进一步影响作业节拍与成功率。

1、从数据、训练到工程优化,压缩机器人等待的时间

为了压缩推理时延并保证模型在真实场景中的鲁棒性,AnuVerse-0.5 在数据、训练和工程三个层面同步发力:

数据端,安努拥有自研数据处理平台,负责平滑、清洗和任务标注,解决工业现场数据质量参差不齐的问题;训练策略上,采用由视频专家和动作专家组成的混合 MoT 架构,通过高效掩码机制实现 " 训练时做视频生成、推理时只推理单帧图像 ";训练范式上,其人在环路真机强化学习让奖励函数自主迭代优化动作轨迹,无论车间光照、背景如何变化,模型都能保持稳定鲁棒、减少人工接管。

工程部署层面,通过 CUDA 图编译、合并算子、减少 kernel launch 开销等优化,并在推理时重构 3D VAE 为 2D VAE,去除队列管理及 Python 逻辑处理,使得模型在消费级显卡上就能部署且时延小于 100ms。

更低的推理时延,可以减少动作过期和等待,让机器人在环境变化后及时生成下一步动作,保持长任务执行过程中的连贯性。

2、已落地工业搬运场景,丝滑执行长程复杂任务

据了解,AnuVerse-0.5 目前已经落地到真实工业搬运场景中完成周转箱搬运长程任务,机器人可以一气呵成完成下蹲、抓箱、起身、转身、放箱和转回等一系列动作,遇到遮挡、反光等情况可以自如应对。

对工业客户来说,百毫秒级推理和单张消费级显卡部署,可以降低硬件投入和改变部署方式,减少依靠更多算力和并行推理所带来的部署成本。这样一来,能够降低扩大应用规模的门槛,机器人进入更多工位时的成本更容易被接受。

算力之外,现场反复调试也是一笔不小的成本。工件位置发生偏移、光照出现变化,或者搬运流程有所调整,都可能让原本能够完成的任务出现新的问题。

长程动作能力与环境适应性的价值,就在于减少这些变化对整段作业的影响,让机器人更换工件、工位时不用重复训练和调试,更快进入实际生产流程。

安努长期深耕工业场景,使 AnuVerse-0.5 的优化始终围绕产线节拍、算力成本和环境变量展开,模型速度由此转化为客户可以感知的部署效率。

三、模型离开实验室后,如何在工厂稳定部署并快速复制?

模型训练完后,进入工厂的工程化工作依旧困难重重。

安努的研发人员告诉我们,在真实项目中,模型训练大约只占整体工作的三成,现场适配、系统对接、可靠性测试等工程化工作决定了剩余七成。

这些问题还会随着工位和任务变化反复出现。如果每次部署都要重新修改底层代码,项目越多,重复开发就越容易消耗团队精力。

所以,安努打造了Nexus 端到端部署系统卡位产业链中最稀缺的「软件定义部署层」,可以统一调度和部署 VLA、WAM 等多类模型,将分散的模型能力组织成面向实际任务的端到端系统。

1、Nexus 填平模型输出与真机执行之间的工程断层

首先,Nexus统一了模型与机器人的 " 动作语言 ",将不同模型的输出转换为 24D 绝对动作,并在部署启动时校验动作名称、顺序和维度等配置。这样一来,更换模型主要通过服务端适配完成,减少重写底层控制链路的工作。

接口对齐之后,还要解决模型推理与机器人执行的节奏差异。Nexus 将大模型推理与机器人控制解耦,VLA 负责低频规划,机器人端以 100Hz 进行插值和伺服执行,并结合 RTC 连续重规划处理动作衔接。新动作到达时,系统按实际时延剔除过期部分;遇到断连、动作队列不足等情况,则保持最后一次成功目标,避免继续执行失效轨迹。

动作下发前,Nexus 还设置了独立于模型的 FK 动作级安全盾。它依据真实关节反馈,沿运动路径检查夹爪、指尖等部位的位置,识别侵入桌面安全区等风险,并将危险动作缩减到设定约束允许的执行范围,同时记录修正过程,便于复盘。这套防护可在更换模型后继续复用。

2、不仅降低跨本体、跨场景部署成本,还把经验沉淀为下一次可复用的产品能力

据安努介绍,Nexus 将共性问题沉淀为标准参数,开发者可以按照软件指引完成适配,使端到端算法模型部署时间缩短 30% — 50%。

并且,这个系统已经能够适配智元全系列及其他品牌本体,跨本体能力可以降低客户更换硬件平台时的重复开发成本,也让模型和技能具备更大的复用范围。

" 一脑多能、一机多用 "也有机会实现:过去,一台机器人对应一个工位,而 Nexus 让同一台机器人可以根据工位切换不同模型和技能,比如早上承担搬箱任务、下午转向分拣任务,提高机器人的设备利用率。

除此之外,安努的整体技术架构还包含真机数据回流机制,机器人执行任务后产生的数据可以重新进入训练链路,形成 " 数据回流—模型训练—真机执行—再次部署 " 的持续迭代的飞轮,机器人在真实场景中干活就能越干越聪明,让下一次部署变得更快、更稳、更便宜。

这个飞轮已经有了实证。据了解,安努在富临精工的首个工位部署用了 4 个月,现在同类型工位已经压缩至 3 天;工程师在现场守了 8 个月,设备平均故障间隔时间(MTBF)超过 300 小时。从模型适配、运动控制到安全防护,Nexus 打通具身模型从算法到真机落地的关键链路,推动具身智能从实验室走向 " 可计算 ROI" 的真实产业现场。

结语:交付只是起点,真正的商业化在于规模复制

在工业场景中,安努站在基座通用模型的肩膀上,用富临精工、英特尔这些真实工厂产线回流的真机数据 + SimLab 仿真平台和 Helios 视频生成的长尾数据,共同训练模型。通过 ActiWorld 负责校验机器人动作结果,筛选有效样本送入拥有抗光照、高鲁棒、自主进化专利的 RoHIL/EvoHIL 强化学习系统完成迭代进化;再经由模型蒸馏,把能力沉淀到端侧垂直小模型 AnuVerse0.5,实现百毫秒级实时响应;最后依靠 Nexus 系统完成产线一键规模化部署。

整套链路形成数据‑进化‑执行‑部署‑回流的内生数据飞轮,不依赖第三方拼凑。针对性地攻克具身智能部署慢、光照干扰、安全性不足、难以复制、泛化能力弱的工程化痛点。

安努的核心壁垒不在于重做一套世界模型,而是在通用基座与真实产线之间,建起一座难以拆解的「检验‑学习‑执行‑落地」技术桥梁,让机器人可以在工厂里边干活边学习,作业稳定性优于人工,迭代进化效率也远超人工调试。

安努依托对工业场景的长期深耕,集齐这 "6 颗商业化宝石 ",最终指向一个目标:让机器人真正走进车间、对接工单,把非标项目经验沉淀为可跨本体、跨场景复用的标准化产品能力。

交付首个项目只能证明团队具备解决问题的能力,唯有将同一套能力低成本复制到第二个、第一百个场景,才算是真正跑通了产品形态与商业模式。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 技能 物理 智东西 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论