盖世汽车 前天
让机器人“摸懂”世界,智在无界发布新一代模型Being-H0.8
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 28 日,通用具身基础模型厂商智在无界正式发布了新一代隐式触觉世界动作模型 Being-H0.8。

据了解,该模型首次将触觉模态系统性引入大规模预训练环节,实现了视觉、触觉、动作与物理世界未来状态的统一表征,标志着具身大模型从 " 视觉观察 " 跨入 " 多模态交互理解 " 的新阶段。

补上触觉短板让机器人 " 摸懂 " 物理世界

在过往的具身智能方案中,视觉几乎是最核心的感知输入,但仅靠视觉很难覆盖真实操作的全部信息,特别是物体是否接触、有没有滑动、施力是否到位,这些直接决定操作成败的细节,往往无法通过画面可靠获取。

这也导致传统方案在插拔、旋拧、精密装配等接触密集型任务中,稳定性始终难以达标。

Being-H0.8 的核心突破,正是首次在预训练阶段就将触觉信息完整纳入隐式世界模型架构,让视觉、触觉、动作与未来状态变化映射到同一套特征空间中,使模型同时理解 " 看到了什么、做了什么、接触到了什么,以及世界会因此发生什么变化 ",形成对物理交互过程的完整认知与预测能力。

图片来源:智在无界

为了适配高频触觉反馈的特点,Being-H0.8 还设计了慢快动作专家机制:系统首先在每个动作时域开始时计算一次 " 世界—动作上下文 " 并进行缓存;随后,在时域内少数几个锚点处,注入最新观测到的本体状态与触觉反馈,动态生成或修正当前正在执行的动作片段。

而针对现有触觉传感器和数据采集系统普遍成本高昂,采集流程也高度依赖专用硬件、触觉手套和受控实验环境,始终无法达到大模型预训练所需的数据规模,智在无界还自主研发了面向大规模无标注人类视频的密集触觉伪标签系统 TactoHand

该系统无需为数据采集者配备触觉手套或额外传感器,即可从普通人类视频中推断手部与物体交互过程中密集空间点的接触概率和连续接近度,以接近零边际成本的方式为海量视频补充触觉监督。

据了解,基于 TactoHand,智在无界首次将触觉信息扩展至超过 50 万小时的人类视频,并将其用于具身基础模型预训练。

另外,在 Being-H0.8 中,智在无界还进一步提出了第二代统一动作空间 TopoHand,为人类手部、灵巧手和平行夹爪提供统一的运动学接口。TopoHand 采用了固定拓扑的 " 螺旋手 " 表征,由 20 个语义关键点和 20 个规范关节变量组成,并以手腕为中心建立统一坐标系:x 轴指向中指指尖在手掌平面上的投影方向,z 轴与手掌法线方向一致,y 轴则用于构成右手坐标系。

在这一表示下,不同本体特有的关节命名、机械结构和网格拓扑均被隔离在策略接口之外,实现了模型不再直接依赖某一具体机器人或人手模型的原始关节定义,而是在统一的语义拓扑和运动学空间中学习操作规律,真正实现大规模人类视频中的操作先验能够更加高效地迁移到多种机器人本体,并显著提升跨本体预训练的效率与可扩展性。

从规模到质量:具身基础模型的三级跳

过去一年,智在无界围绕大规模人类视频预训练,已经完成了多轮迭代,其演进路径也折射出具身智能行业在数据层面的共性发展逻辑。

第一阶段从 Being-H0 到 Being-H0.5,核心是验证 " 人类视频能不能用来训练具身基础模型 ",完成了从 0 到 1 的可行性验证;

第二阶段从 Being-H0.5 到 Being-H0.7,目标是解决 " 怎么规模化使用人类视频 ",数据规模从数万小时攀升至 20 万小时;

到本次发布的 Being-H0.8,正式进入第三阶段,重点是如何用高质量、多模态的数据持续驱动模型进化。触觉模态的加入与全栈数据 - 模型管线的完善,正是对这一问题的回应。

智在无界成立于 2025 年 5 月,目前已构建起从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施。

从 Being-H0 到 Being-H0.8,历经多轮迭代,智在无界已经汇聚了超过 500,000 小时的第一人称视频数据,并与数十家数据合作伙伴建立了合作。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 物理 传感器 自主研发
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论