AI科技评论 5小时前
乐聚发布垂域具身模型:一倍工业提效,两项榜单第一
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

如果说,基础模型是具身大脑的 " 大学 " 通识课;那么,垂域模型则是机器人在工业领域的 " 专业课 "。

作者丨董子博

编辑丨林觉民

今天要做世界模型,所有人都知道要做预训练,来让具身大脑变得更聪明;也知道要做后训练,让机器人可以在专门的任务下得到锻炼、做得更好。

和不少公司聊过,AI 科技评论发现,谈到中训练(Mid-train)的公司却很少。

而实际上,在具身的实际落地中,却存在一些原有方案不易解决的问题:当预训练的 VLA 模型,没法在具体的场景中发挥全部智能;而后训练却有时间、成本的门槛;在训练技能的环节,也容易出现数采、训练和调试的重复工作—— VLA 落地要真正提效,中训练或许才是破局的良方。

AI 科技评论独家获悉,乐聚机器人将推出面向工业场景构建的"垂域具身智能模型" —— KUAVO VLA据了解,该模型以通用 VLA 基础模型为能力起点,使用 600+ 小时 KUAVO 同构型真机数据进行了中训练,将本体适配、基础操作和工业场景的共性能力沉淀到模型中。

乐聚机器人 KUAVO VLA 赋能下,在不少场景中可以实现大约一倍的提效,在某些任务中甚至可以做到100%的成功率。

模型中训练,会成为具身工业落地的杀手锏吗?在这个仍然充满未知的方向上,乐聚机器人先趟出了一条路。

01

什么是 " 垂域具身模型 "?

面对具体任务,基础模型的智能能够完成指令理解、任务规划、物理世界预测的要求,但要机器人实际可以执行任务,后训练往往需要投入千条以上的数据。

而为了填补这个鸿沟," 垂域模型 ",是乐聚机器人为 KUAVO VLA 做出的全新定义。垂域模型,就是通用基模和具身技能之间的 " 中间层 ",相当于在基模与技能之间插入了一层针对工业场景的一轮中训练。

乐聚的思路是:先把 KUAVO 本体能力和工业场景中的共性能力训练进垂域模型,再把具体技能的学习范围收敛到工业场景。模型可以因此获得更高的能力起点——达到相同技能效果时,可以减少重复的数据采集、训练和调试工作,把资源集中用于决定任务成败的关键差异上。新任务的开发逻辑,也因此从 " 重新学习 " 转变为 " 在已有能力上快速适配 "。

在基模难以实际在本体中发挥智能时,垂域模型可以依靠详细训练过的 100 个 " 工业共性能力 ",包括分拣、搬运、上下料、装配等典型操作,让模型省去繁复的后训练步骤,可以快速依靠 " 原子动作 ",找到完成任务的方式,甚至实现能力的泛化。

与跨本体混合训练不同,KUAVO VLA 训练的真机数据全部来自 KUAVO 单一构型,使得模型能够持续、集中地学习同一套动作空间、运动特性和控制规律,减少不同本体之间的数据差异对技能学习的干扰。因此,模型的垂域能力能够与本体深度绑定,显著减少了模型在 KUAVO 上的推理误差,让本体的执行效率大幅提升。

总结下来,用简单的话来讲:如果说,基础模型是具身大脑"大学"通识课;那么,垂域模型KUAVO VLA则是机器人在工业领域的"专业课"——一个人聪不聪明,得看通识课懂的多不多;但他能不能真的在实际场景干活,还得看他的专业课成绩。

在工业场景下,垂域具身模型的好处是显而易见的。

首先,它能够减少本体适配成本。通用 VLA 覆盖不同机器人本体和多种场景,数据中天然混杂大量跨本体样本;当模型进入 KUAVO 真机时,仍需重新学习本体的动作空间、运动特性和控制规律。

其次,它能减少场景端数据训练的成本。通用 VLA 模型面向开放泛化场景训练,需要采集海量多样化的现实场景数据,覆盖各类环境、物体、任务,数据体量巨大、采集标注成本高昂。而工业垂域具身模型聚焦特定工业任务与作业环境,无需对全量开放世界做泛化训练。可以复用工业现场真实作业样本,聚焦工位、物料、工艺流程做数据构建,大幅降低无关场景的数据采集、清洗与标注开销,实现用更少的数据完成任务收敛,提升模型训练的投入产出比。

此外,开发者训练新的技能不再需要从头开始,可以把资源和精力更多地投入到针对不同任务场景进行模型能力优化适配上,显著缩短了从基础模型到技能落地的开发路径。

02

Benchmark:

两项核心指标均列第一

KUAVO VLA 的评估体系共设置 25 项任务,包括 20 项定制化工业任务,以及从公共任务集 GM100 中选取的 5 项任务。前者检验模型对工业物料、工位和流程的适应能力,后者观察在公共任务上的迁移与泛化表现。对照模型为 π 0.5、GR00T N1.7 和 Lingbot-VLA 2.0 三种通用基模。

综合结果中,KUAVO VLA 整体任务成功率达 48.27%,过程分达 74.51%,两项指标均位列第一。相较于基模 Lingbot-VLA 2.0 ,其任务成功率为 16.27%,过程分为 42.06% —— KUAVO VLA 成功率提升 32%;过程分提升 32.45%。

成功率与过程分同步提升,说明垂域训练带来的收益不仅体现在任务是否完成,也体现在执行过程本身。在真机运行中,KUAVO VLA 表现出更好的动作平滑性、决策稳定性与执行一致性,动作抖动、重复修正和决策迟滞明显减少——这些变化对于包含多步操作、连续抓放和狭小工位约束的工业任务尤为重要。

03

什么样的模型架构,

才对二次开发更加友好?

当前的具身公司们,已经开始逐渐开始认识到一个真理:想让具身智能持续进化,一家公司的力量远远不够——谁能服务好具身的二次开发者们,谁才能更早让自己的数据飞轮转起来、让技术产品生态活起来。

对这件事,乐聚机器人的理解很通透,乐聚常务副总裁柯真东对 AI 科技评论表示:" 未来会有很多具身开发者,要沉到行业里去,在场景里把相应的技能调出来——为了他们,乐聚提供的就是平台、模型和工具链等等。"

这段时间里,乐聚办了不少具身开发的比赛,找到了不少优秀的开发者,给他们配置了工具链、机器人的培训,并且设置了一整个服务二次开发生态的团队,直接端到端地帮助开发者解决他们实际遇到的问题。对这个服务团队来说,柯真东对 AI 科技评论分享,拿到用户真实的对工具链的反馈、并实际解决他们的问题,就是他们的考核指标。

而在密切的接触中,乐聚机器人慢慢明白了一个朴素的 " 真理 ":对二次开发团队来说,能够让他们赚到钱的平台,就是最好的平台。

但时下,大多数的开发者都已经发现,要做好模型的后训练,不仅消耗大量时间,也需要千条以上的数据;而面对不同类型的任务,开发者的工作无法完成迁移,也就更谈不上积累,工作重复、算力浪费的现象时有发生,让时下最前沿的开发工作,变成了最低级的劳动密集型 " 苦工 "。

即使解决了这些问题,由于模型和本体耦合程度不足,导致模型的推理和控制能力无法发挥,二次开发者的实际交付效果也时常不尽如人意。

KUAVO VLA 的出现,最直接的受益者就是具身的二次开发者们。过去耗时、耗钱的技能开发,现在可以用效率更高、浪费更少的方式完成,并且门槛更低、过程更快、效果更好——这是可以让开发者们,可以实打实赚到真金白银的方法。

" 我们希望在未来,能够给二开(二次开发)提供一个更好的环境——这也是未来乐聚在整个具身智能大生态里,我们最核心的竞争力。" 乐聚常务副总裁柯真东如此对 AI 科技评论表示道。

04

结语

环顾具身行业,能够做出 KUAVO VLA 这样成果的公司,其实并不算多。

在前沿技术上,乐聚有探索的眼光,才能发现后训练在模型落地时的掣肘、找到垂域模型的方案;在工业领域,乐聚有实践的经验,才能归纳出机器人最有价值的 " 原子动作 ";同时,乐聚不只在真实产线,还在自家行业领先的训练场里,获得了海量的、适合中训练的数据;并且,乐聚不绑定基础模型,就可以通过合作的方式,让开发者自由地在模型间迁移,并能够享受到性能的提升。

KUAVO VLA 的诞生,不仅是乐聚在具身版图上的再下一城,更是行业在具身大脑技术范式上的一次新的探索——当更多开发者实打实地尝到了KUAVO-VLA的甜头,或许就是垂域模型的方案真正成为一种"显学"的时刻。

在柯真东的心里,乐聚在做的垂域模型,就是一种 " 让鞋子上沾泥 " 的事情——是把脚深深地踩进实际的场景中,让几年来乐聚积累的工业 Know-how 实际积累到模型当中,并通过 KUAVO-VLA,帮助更多二次开发者拿到订单,支撑他们长远地走下去。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 乐聚 技能 破局 物理
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论