虎嗅APP 2小时前
腾讯的野心藏不住了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Tairos 要做具身时代的 " 安卓 "

出品|虎嗅黄青春频道

作者|商业消费主笔 黄青春

题图|视觉中国

外界总揶揄腾讯在 AI 赛道 " 起大早赶晚集 ",这显然低估了其野心。

事实上,腾讯的布局草蛇灰线,伏线千里:从底层混元大模型,到中间层智能体开发平台 ADP、具身智能平台 Tairos,再到应用层 WorkBuddy、CodeBuddy 等产品,一条从底层技术到终端应用的落地路径脉络清晰。

其中,具身智能作为腾讯向物理世界延伸的 " 战略要塞 ",由腾讯首席科学家、Robotics X 实验室主任、福田实验室主任张正友带队,摸索出一套与行业主流 " 端到端单模型 " 截然不同的技术路线,底层逻辑直指具身智能的本质:语言不等于完整认知,真正的智能必须在 " 感知、决策、行动 " 的闭环中形成。

具身智能为何不智能?

张正友以神经科学经典的 " 裂脑实验 " 点破行业通病:当前多数具身方案过度依赖语言模型逻辑,错将流畅描述任务视作真正理解了物理世界。

事实上,人脑左脑负责语言与逻辑推理,右脑负责空间感知与图像认知,语言只是智能的对外表达通道,并非认知的全部。

基于这一判断,腾讯构建了三层异构的具身智能架构 Apexio,精准对应人脑的认知决策、感知行动、条件反射:

最上层为认知系统:按需唤醒,调用大模型完成深度推理与任务规划,核心回答 " 要做什么 ";

中间层为感知行动系统:接收视觉等环境信息并快速调整行为,负责 " 怎么动态调整 ";

最底层为反射系统:以更高频率运行,无需经过语言推理,像条件反射一样处理碰撞、失衡等突发状况,具备 " 即时自保 " 能力。

在张正友看来,这套分层架构是面向真实场景的长期技术路线,其核心优势贴合物理世界的运行规律。

此前,行业单一端到端模型要求感知、决策、执行全链路同频运算:要么为保障认知精度拉高推理延迟,无法满足实时性要求;要么为压缩响应速度牺牲深度推理能力,难以处理复杂任务,导致主流具身模型存在普遍短板:一类靠文本拆解任务,逻辑清晰却落不了地;一类能生成预测画面,却讲不清规则与边界。

与之对应,分层架构能让不同能力模块各司其职,既保留了上层的深度思考能力,又满足了底层的实时反应需求,与人脑运行逻辑高度契合,是更具稳定性的长期技术架构。

据虎嗅了解,腾讯发布的 RxBrain (腾讯 Robotics X 联合混元发布并开源的具身世界认知基座模型)实现了两类核心能力打通:面对复杂任务,它既能用语言拆解执行步骤、明确规则约束,也能同步生成每一步的目标场景图像。这种 " 先想象目标,再执行动作 " 的模式,解决了大量文本难以精准描述的场景问题。

比如摆放西餐餐具,用文字定义规则需要大量篇幅,一张目标图即可清晰传递要求。执行过程中,机器人还能实时对比当前画面与目标画面,判断执行进度,发现偏差及时重新规划,显著提升任务完成效率。

张正友补充称,腾讯自研的 HyVLA-0.5 模型已实现工业级落地,依托自研亚毫米级 UMI 穿戴式数据采集手套,积累了超过 1 万小时的人类第一视角操作数据。其采用双路径训练模式:一条针对特定机器人本体做精细化微调,保障场景适配精度;一条通过 UMI 数据实现跨本体迁移,提升通用适配能力。部署环节则通过异步推理与轨迹平滑技术,实现高频闭环控制。

虎嗅沟通发现,这套模型已在日化品工厂产线完成落地实测,作业成功率超过 95%,新增品类(SKU)适配周期不到 3 天,完全满足工业产线的严苛要求。

除了产线落地的成绩,HyVLA-0.5 在权威仿真评测中也拿下综合排名第一,在核心的长时序任务、记忆任务两个维度同样登顶,完成了从实验室指标到真实生产力的跨越。

Tairos 要做具身时代的 " 安卓 "

此前,腾讯始终明确不做机器人硬件,一度曾引发外界质疑。

对此,张正友以手机行业格局类比:行业最终会形成两种成熟模式,一种是苹果式的软硬件全闭环,体验最优但生态封闭;另一种是安卓式的底层系统赋能,开放生态、规模化落地。

如今,腾讯选择的正是第二条路。这很大程度上源于,中国机器人本体制造能力已高度成熟,迭代快、稳定性强,腾讯无需重复造轮子。

腾讯的核心优势在 AI、云与连接能力,因此 Tairos 定位是做具身智能的 " 通用大脑 ":向上支撑应用开发商,向下赋能机器人本体厂商,让硬件厂商无需从零搭建智能能力,让应用厂商无需适配五花八门的硬件,整体降低行业落地门槛。具身智能的下一场竞争,为什么不只在机器人本体上?

据虎嗅了解,落地数据已验证这一战略的价值:首次和宇树打磨导览场景时,基础适配花了三个月,依托标准化接口后,新增场景 5 天即可落地;给越疆机器狗做系统适配更是只用了一天就完成部署。

张正友透露,腾讯选择优先绑定越疆、宇树、智元等头部本体厂商,核心逻辑在于:头部厂商的硬件稳定性高、问题少,算法打磨效率更高。" 一旦与头部厂商跑通标杆场景,围绕其布局的集成商、生态客户即可快速复制方案,实现做通一个、辐射一片的效果,效率远高于零散对接中小厂商。"

值得强调的是,具身智能核心瓶颈仍是数据,亦是当前行业投入成本最高的环节。

张正友认为,当前行业普遍依赖的遥操作数据,正处于金字塔顶端,成本高、规模小、泛化性差。腾讯的思路是打通四层数据体系:用底层大规模数据做预训练,提升模型泛化能力;用顶层高精度数据做微调,适配特定场景,最大化数据利用效率。

即便腾讯并非数据采集服务商,但其核心优势在于模型研发与数据生产的联动:模型团队明确数据优化方向,反向指导数据厂商定向采集高价值数据,再通过腾讯云的存储、计算能力,为具身智能企业提供数据存储、处理、训练的一体化解决方案,形成 " 数据 - 模型 - 云 " 的完整闭环。

算力层面,具身智能的需求正呈爆发式增长。

腾讯云异构计算研发总监陈煜东透露,具身智能客户的算力需求年增速达 200%-300%,训练规模从百卡级跃升至千卡、万卡级;模型迭代周期缩短至两三天,多模态数据清洗、标注的算力消耗也同步暴涨。

至于国产芯片的适配难题,陈煜东给出了高效解法:用 AI Agent 辅助算子迁移。" 过去工程师手动迁移一个算子平均需要 5 天,如今通过 Agent 人机协同,一天就能完成精度达标、性能更优的迁移,大幅降低国产算力的使用门槛。"

当前,具身智能行业同质化严重,本体形态、落地场景都高度扎堆。张正友认为,这是行业早期的正常状态,规模化落地尚未启动,玩家集中探索可行场景并非坏事,充分竞争会加速技术迭代。

所以在落地节奏上,行业必然遵循 " 从易到难 " 的路径:工业场景会率先实现规模化落地,因为环境结构化、物体类别少、任务标准化,数据需求相对可控,更容易达到生产级要求;而家庭、养老等非结构化场景,落地难度要高得多,核心门槛是安全。

张正友一再强调,进入家庭场景的机器人,安全性必须做到 100%,没有任何妥协空间。" 要实现安全的人机接触,触觉、力觉感知是必备能力。没有力觉控制的机器人,搀扶老人时可能造成骨折,根本无法进入养老、康复等场景。"

综上,腾讯在 AI 领域并不执着于技术噱头式领先。互联网时代,其靠连接人与人、人与服务、人与内容建立壁垒;AI 时代,它要靠连接模型与场景、智能与硬件、开发者与产业,成为 AI 基建的 " 水电煤 "。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 安卓 物理 虎嗅 神经科学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论