触觉的天花板,比想象中更高。
作者丨高景辉
编辑丨马晓宁
每年的世界人工智能大会(WAIC),都是 AI 行业趋势的集中体现,无比火爆的今年更是如此。AI 科技评论观察到,今年 WAIC 具身智能赛道出现了一个非常有意思的现象:几乎所有做灵巧手的公司,都在不约而同地强调自己的 " 触觉 " 能力。
放在两年前,触觉还没有引起行业的广泛重视,但今年不一样了。雷峰网 ( 公众号:雷峰网 ) 发现,从传感器厂商到整机公司," 触觉 " 成了每家展台的核心关键词,甚至有人直接喊出 " 触觉比视觉还重要 ",行业明显开始 " 卷 " 了起来。
更值得玩味的是 " 卷 " 的程度。有的企业不止自研触觉传感器,还自研触觉模型,自己采触觉数据,甚至连最底层的触觉芯片都要自己做。一家做传感器的公司把手伸到了芯片和算法领域,这在传统硬件行业是相当少见的。
那么问题来了:为什么大家突然开始卷触觉?这么大力度的投入真的有必要吗?
01
机器人的触觉,需要 " 专属 " 的模型
触觉之于灵巧操作的重要性,行业其实早有共识。随着具身智能从 demo 走向真实场景落地,纯视觉灵巧操作方案的天花板越来越明显,毕竟摄像头有盲区,感知不到手指和物体之间的细微接触,就像视力再好的人戴着手套做针线活,看得见线头,却感觉不到针有没有穿过去。
于是,过去一两年,整个行业都在做同一件事:把触觉模态 " 加 " 进现有的 VLA 模型里。听起来顺理成章,多一个感知维度,模型能力总该更强吧?
但最近一篇名为 "T-Rex" 的论文,给出了一个反直觉的答案:直接把触觉硬塞进模型,效果反而更差。
这篇论文的阵容堪称 " 神仙级别 " ——李飞飞、NVIDIA 的 Jim Fan、UC Berkeley 的 Trevor Darrell、Pieter Abbeel ……几乎集齐了全球 AI 与机器人领域最顶尖的研究者。他们做了一个最直观的实验:给行业经典模型 π 0.5 加上触觉条件后,任务成功率从 17% 直接跌到了 6%。
为什么会这样?因为机器人的模型能力,不能靠堆叠模态来提升。
触觉信号和视觉信号本质上是两种完全不同的信息。视觉是低频的、全局的,5Hz 就能完成一次场景理解;触觉是高频的、局部的,需要 20Hz 甚至更高频率才能捕捉到滑移、形变这些细微变化。把两个频率、逻辑都不一样的信号硬塞进同一个处理通路,只会互相干扰,就像让 GPS 导航和方向盘微调共用一个芯片,两个系统抢方向盘,车反而开不稳。
更重要的是,T-Rex 验证了一个判断:触觉不是视觉的附带品,它需要自己的时序编码、自己的处理通路、自己的训练范式。
这也解释了为什么一些触觉传感器头部企业,比如他山科技等,要投入资源做 " 原生触觉模型 "。想要触觉真正参与控制闭环,就必须有专门适配触觉特性的模型架构。这不算一种 " 卷 ",更不是重复造轮子,而是从实际需求出发,解决行业的 " 真问题 "。
02
芯片是底层基建,从什么时候开始做都不算早
如果说 " 做专属触觉模型 " 还能形成小范围行业共识,那么 " 自研触觉芯片 " 面临的争议就要大得多。
有不少从业者提出质疑,当前触觉传感器的技术路线都还没完全收敛,量产规模也不算高,落地场景更不够稳定,现在就自研芯片,是不是太早了?投入产出比算得过来吗?
这个疑问不能说没有道理。芯片研发的周期长、投入大、风险高,通常是行业进入成熟期、需求量足够大之后才会做的事。一家创业公司提前几年布局芯片,怎么看都像是一场豪赌。
但换一个角度,从第一性原理思考,结论可能完全不同。
机器人的终极形态是拟人化的。而拟人化的技术方向,必然朝着低功耗、低延时、核心指标持续升级的路径演进。这些底层诉求,最终都要靠芯片来承载。
还有一个更现实的问题是,现有的通用芯片,根本满足不了机器人触觉的落地需求。
触觉感知不止有模拟信号采集这一层。要完成一次完整的触觉反馈,需要模拟前端、端侧小算力 MCU、电源驱动、信号路由等一系列芯片协同工作。指尖传感器的触点密集、体积极小,对集成度的要求非常高,单颗高度集成的专用芯片,远比多颗分立芯片的方案更优。
很多中国的传感器公司一开始也用海外大厂的芯片,但很快发现两个问题:一是单一芯片支撑不了完整的触觉技术栈,二是通用芯片的参数不是为触觉场景优化的,测量频率、通道数配比、弱信号感知能力,都有明显短板。
但自研芯片带来的提升是实打实的。2021 年他山科技发布全球首款 AI 触感专用芯片 " 红宝石 "。今年 WAIC 上他山科技最新发布的 " 绿宝石 " E10A 芯片,更是能将触觉感知信号直接在硬件层面转为脉冲信号。在此之前,脉冲转换需要先把模拟转成数字,再通过软件转脉冲;现在直接硬件完成,效率和延迟都上了一个台阶。
测量频率上的提升更明显。行业普遍的单传感器测量频率在几十赫兹量级,而他山的新款芯片沿用原有模式频率就能提升 2-3 倍,切换到脉冲输出模式更是提升 100 倍,有了如此高的频率,就能捕捉指尖更精细的变化。
更深一层看,芯片研发有自己的时间周期和技术沉淀规律,不能等产品快要大规模落地了才开始做芯片,那样至少会落后两到三年。从这个意义上说,早布局也是为未来的落地窗口提前铺路。
当然,不是每家公司都有能力、有必要自研芯片。这需要深厚的模拟芯片设计积累、足够的量产经验支撑,以及对触觉场景的深度理解。但对于头部企业而言,芯片作为底层基建,从什么时候开始做都不算早。
03
自研数采设备,可能只是一种 " 水到渠成 "
与 " 自己做芯片 " 不同," 自己采数据 " 这件事,行业基本已经形成了共识。因为具身数据这个赛道,商业化供应链还很不成熟,第三方数据供应商的产品很容易同质化。大家都用差不多的采集方案、差不多的任务场景,训练出来的模型自然也拉不开差距。想要建立数据壁垒,最终还是得自己采。
但更值得讨论的问题是:为什么连数据采集设备本身,也需要自研?
市面上不是没有现成的方案。外骨骼、数据手套……这些构型都存在很多年了。但真正用到触觉数据采集上,问题就暴露出来了。
最常见的柔性触觉手套,大多基于压阻方案。这种方案有一个致命缺陷:数据一致性太差。柔性基底加柔性传感器的组合,误差会被层层放大,弯折过程中即使没有受力,也会产生数据跳变,还存在数据残留、漂移等问题。行业对柔性手套的触觉数据容错率原本放宽到 30%-40% 的无效数据,但实际使用中,大部分数据都是无效的。
外骨骼方案倒是能保证关节位置数据的精度,但它体积大、成本高、佩戴复杂,很难规模化推广。而且外骨骼主要采集的是关节角度,触觉信号本身还得另想办法。
于是,一些擅长做 " 触觉 " 的公司开始尝试新的构型。比如今年 WAIC 上,他山科技就推出了一种指套式的采集方案,戴在指尖上即可,因为指尖是实现抓取等功能的核心部位,优先级远高于指肚、指腹、手掌,先把最关键的数据做好;另外,指套不会遮挡手部关节,可以同时用摄像头捕捉关节运动数据,不需要额外通过外骨骼或 IMU 采集,也能保持高一致性。
不过,也不用把自研数采设备上升到 " 战略布局 " 的高度,它更像是一种 " 水到渠成 " 的结果。
他山科技已经有了自研芯片、有了成熟的传感器硬件、有了上百家客户的量产经验,再做数采设备的门槛其实已经很低了。芯片是自己的,传感器是自己的,客户需要什么样的数据最清楚,无非是把这些能力重新组合成一个新产品。
更何况,作为一种产品,数采设备的核心无非是解决用户的痛点,而他山在解决 " 测量一致性 " 这一数采最大痛点上,本就领先了行业一个数量级。他山的传感器多次测量标准差≤ 0.03,确保每次采集均获得高度一致的数据输出;同时线性拟合优度 R ² ≥ 99.9%,能够真实反映受力变化。即使是 " 水到渠成 ",其 " 水质 " 也是越高越好。
除此之外," 数采自研 " 这件事对整个行业都有益。数据采集的门槛降下来,更多团队才能投入到触觉模型的研发中,整个生态才能转起来。从这个意义上说,头部企业自研数采设备,其实是在做大蛋糕。
04
触觉的天花板,比想象中更高
把视角再拉高一层," 卷 " 触觉这件事,可能本身就是必要的。因为触觉的价值,可能远比我们现在想象的要大。它不只是 " 让灵巧手操作更精细 " 这么简单,还可能是打开物理 AI 下一扇门的钥匙。
今年 WAIC 上,图灵奖得主 Richard Sutton 在演讲中提到一个核心观点:未来的 AI,应该 " 在自己的生命过程中不断学习 "。
这句话翻译成机器人领域的语言,其实就是真机强化学习,即让机器人像人一样,在真实世界里通过试错自主成长,而不是完全依赖人类标注的数据。
这个方向听起来很美好,但为什么过去一直没能跑通?
成本当然是一个原因。真机太贵了,摔坏一台心疼半天,谁敢让它随便试错?
但还有一个更深层的原因,那就是如果没有触觉,真机强化学习根本无从谈起。
想想人类的成长逻辑。婴儿时期,如果只能保留一种感知,首选一定是触觉。因为触觉是最基础的安全反馈机制,比如碰到烫的会缩手,抓不住的东西会掉落,用力太大会疼。没有触觉,婴儿根本无法安全地与世界、物体、人交互。
机器人也是一样。纯视觉的机器人," 看 " 得到物体,但不知道自己用了多大劲、有没有抓稳、会不会捏坏。让这样的机器人去自主试错,要么把东西全弄坏,要么自己摔得稀碎,强化学习的 " 奖励函数 " 根本无从建立。
触觉提供的,恰恰是最直接的物理反馈。只有能感知到伤害,才能学会避免伤害;只有能感知到接触状态,才能学会调整力度。这正是真机强化学习最需要的闭环信号。
这也是为什么 Richard Sutton 会和他山科技合作,共同建立 " 机器人幼儿园 " 项目。双方想验证的,就是一套基于触觉的 AI 自训练、自学习新范式,让机器人像孩子一样,从触觉出发,在真实交互中逐步成长。
7 月 18 日,Richard Sutton 来到他山科技的 WAIC 展台,现场分享了 " 机器人幼儿园 " 理念。他提到:" 我们不只希望机器人用手指获得触觉,我们希望能让机器人的全身都具备触觉能力。为了强化学习的目标——能够通过试错算法持续改进。并且让机器人拥有足够‘强壮’的硬件,能够不断试错、摔倒了再爬起来,这一点特别关键。"
Sutton 表示,他山是触觉感知领域的领导者,在触觉感知在探索和从经验中学习方面非常出色,同时他山对于 " 从经验中学习 " 这个理念的共鸣,以及他们根本上对科学探索和开放的态度,让 Sutton 选择了他们。
雷峰网认为,未来这个方向如果跑通,意义将远超 " 灵巧手更灵活 " 这件事本身。它意味着机器人的学习方式可能发生根本变化:从 " 人类教什么会什么 ",变成 " 自己探索、自己学习、自己成长 "。
当然,这条路还很长,现在的触觉距离人类那种分布式的、全手的、多模态的触觉感知还差得远。T-Rex 论文自己也承认,缺少手掌触觉、缺少温度感知,这些都是未来需要补的课。
但方向已经越来越清晰了。
从 T-Rex 验证 " 触觉需要专属模型架构 ",到企业自研芯片筑牢底层基建,再到数采设备降低数据门槛,最后到真机强化学习探索终极范式,整个行业正在从不同层面,共同把触觉的天花板往上推。
回过头看, WAIC 上的 " 卷触觉 " 更像是一个信号:具身智能的竞争,已经从 " 有没有 " 进入了 " 好不好 " 的阶段。视觉的红利吃得差不多了,下一个突破口,大概率就在触觉。
触觉这条赛道,远比表面看起来更深。那些愿意沉下心做底层技术的公司,可能会在未来某个节点,突然爆发出惊人的势能。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。


登录后才可以发布评论哦
打开小程序可以发布评论哦