新浪财经 10小时前
专访大晓机器人王晓刚:以人为中心,构建具身智能的“开悟”之路
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

(来源:BCG 波士顿咨询)

具身智能产业的崛起,既是人工智能从 " 数字大脑 " 走向 " 物理身体 " 的必然演进,也是各国在新一轮科技竞争、先进制造重塑与人口结构变迁背景下必须把握的战略机遇。

BCG 全球智库近期启动 " 中国具身智能产业 " 系列研究,重点关注具备自主感知、决策与执行能力、拥有在多类物理场景中持续泛化与价值延展能力的具身智能系统及其产业生态。

本系列访谈对话海内外具身智能产业核心掌舵人,围绕技术路线选择、商业化落地路径、企业组织架构搭建背后的真实决策逻辑展开深度探讨,同步分享行业前沿研判与长期发展洞察。我们旨在萃取一线产业实战经验,为具身智能产业下一阶段的演进提供具备参考价值的思考。

本期受访嘉宾:王晓刚

大晓机器人聚焦具身智能赛道,提出 " 以人为中心(Human-centric)" 的 ACE 研发范式,致力于推动 AI 从 " 数字世界 " 迈向 " 物理世界 ",核心团队由前沿技术与产业实践的顶尖人才组成。

王晓刚先生现任大晓机器人董事长,同时为商汤科技联合创始人、执行董事。2014 年率团队实现计算机视觉识别率首次超越人类肉眼,助力商汤成长为全球顶尖 AI 视觉企业,2025 年带队创立大晓机器人。

请问您为什么选择这个时间点进入具身智能赛道?当前具身智能行业的普遍技术痛点是什么?贵司提出了怎样的研发范式?

王晓刚:真机数据采集 +VLA 是之前的研究范式——在实验室做数据采集,积累速度非常慢,真机数据只能给特定机器人使用,行业里大概投入十万小时量级,第二年型号改变之后又得重新采集,不可持续。

当前行业的普遍情况是,大家不太关心中间物理世界的表达和因果逻辑,视觉输入直接对应机器人物理参数输出,这与机器人型号、特定任务强相关,而不同机器人都有自己的模型。整个行业都在期待机器人迎来 "ChatGPT 时刻 ",也就是能完成新任务、实现智能涌现。

针对这个方向,我们提出了 " 环境式素材 + 世界模型 " 的 ACE 研发范式,再配合大脑模组,将来把世界模型封装到里面,可以适配到各种不同类型的机器人身上,实现未来具身智能的 "ChatGPT" 时刻,从而达到快速部署的阶段。

具体成果上,我们的新加坡团队在 2025 年 3 月提出了环境素材概念,并发布了 ego life 数据集;我们从 2024 年开始研发世界模型,2025 年已经走到了国内前沿,并率先在自动驾驶实现了驾驶闭环。发布之初,ACE 范式是行业内的开创性探索,现在几个月过去,已经成了具身方向的主流趋势。

您觉得要实现跨本体的通用智能,核心要解决什么问题?您的团队具体是怎么做的?

王晓刚:跨本体数据对齐,核心是消除 " 人采集的行为数据 " 与 " 不同结构机器人的本体数据 " 之间的差异,让通用的大脑模型可以适配多种机器人,具体包含四个维度:

空间对齐——不同机器人各自以自身为中心建立坐标系,空间对齐就是把所有数据映射到同一个统一的 3D 坐标系,让人和不同机器人的动作在同一套标准下被理解。

物理形态对齐——每款机器人结构差异极大(单臂 / 双臂、手指数量、关节方式各不相同),通过模型学习,把不同机器人的形态参数映射到统一描述空间,让肢体动作可以被同一套逻辑转换。

时间对齐——人的动作节拍快,机器人执行节拍慢,对速率做适配调整,保证动作逻辑可以平滑迁移。

数据质量对齐——通过自动打标签,从原始采集数据中筛选高质量片段,过滤噪音,保证训练数据质量统一。

更关键的是,要把原始数据映射到物理空间属性,构建中间表达(比如生成家庭场景的 3D 空间并标注物品物理属性),同时引入思维链,让机器人像人一样理解世界,而不是简单的 " 视觉→动作 " 映射。只有做到这一步,才能真正实现跨本体的通用操作。

您预计具身智能的数据规模临界点大概在什么量级?贵司的数据采集方案有什么特点?

王晓刚:从行业来看,去年的数据体量大概是 10 万小时量级,我们期望未来两年能积累到千万小时量级,在世界模型的加持下甚至可以达到上亿小时,和自动驾驶领域的体量相当——可以参考特斯拉的数据规模。

数据质量也非常关键,不是光堆数量就行。我们的数据采集方案除了记录手部运动,还配备了 360 度全景相机、力触觉手套,能综合记录肢体运动、周围环境以及物理属性,保障数量和质量。

贵司在机器人本体上选择了四足和轮式双臂两条路线,背后的选择逻辑是什么?

王晓刚:四足机器人天然适配开放场景,移动稳定性强、行进效率高,但此前存在明显局限——依赖人工遥控,无法自主导航与自主探索。为四足机器人加装算力背包后,可在室内外全场景实现自主移动与环境探索,单台后台设备可远程同时控制几十台机器狗;这套空间智能能力具备通用性,未来双足机器人稳定性达标后同样适用。应用场景包括巡检、文旅导览、辅助导盲、老人陪护等,单项能力打穿后可快速横向复制。

选择轮式双臂机器人的核心考量是安全性风险,因此先 B 端后 C 端。大体积作业机器人进入家庭后,一旦操作失误极易引发安全事故,面临严格的安全合规要求。因此优先切入 B 端受控场景,场景内保留远程人工干预机制,待软硬件稳定性充分验证后再进入 C 端市场。

B 端场景选择优先考虑高可复制性的行业,原因有两个:第一,硬件规模降本——当前单台机器人成本高达数十万,出货量不足是核心原因,一旦在单一行业形成上万台级订单,可快速拉动产业链成本大幅下降;第二,数据规模积累——高可复制性的行业往往拥有成千上万的一线工人,全员配备采集设备可在短时间内快速达成千万小时级数据目标,而 C 端家庭场景难以动员大规模人群参与采集,数据起量速度远慢于 B 端场景。

贵司如何设计商业模式?又是如何规划变现路径的?

王晓刚:公司定位为软硬一体产品提供商,自身不做终端场景运营,通过与行业运营公司、头部场景企业合作完成商业闭环。核心逻辑是通过机器人实现人力替代,让运营方算得清投入产出账,最终落地无人化运营。

典型合作案例:以无人零售场景为例,公司与商汤旗下善慧合作,由善慧负责点位选址、成本管控与日常运营,公司提供机器人产品与智能化能力;该项目规划当年铺设 1000 家门店,次年扩展至 1 万家,随规模扩大形成稳定批量采购。

变现路径分三阶段:与专业运营公司合作,联合落地项目验证场景价值;随运营方规模起量,转化为批量 B 端采购;待行业标准、技术成熟度与安全合规体系全面成熟后,拓展消费级市场。

作为 AI 原生的具身公司,贵司内部的组织运营模式是怎样的?

王晓刚:我们内部是三种组织模式并存,兼顾产品稳定性与技术创新效率。

传统职能模式:产品、供应链、质量管控等环节完整借鉴车厂成熟体系,由固定职能团队负责,保障硬件交付品质;团队同层办公,商务、产品、研发可快速碰撞问题,缩短决策闭环。

平台型组织:搭建统一的数据平台与硬件平台,全公司共享数据资源、训练经验与硬件能力,为所有创新项目提供底层支撑。

自下而上的创新项目制:针对世界模型、具身算法等技术路线尚未收敛的方向,采用小团队项目制,周期多为 2-3 个月,设定清晰短期目标,在 AI 工具加持下快速迭代。公司给予团队高度自由度,每周同步各小组训练经验与数据方案,所有成果全平台共享,支持快速试错与相互借鉴。技术路线与核心决策多从一线实践中自下而上涌现,公司据此动态调整研发方向。公司核心聚焦技术突破与标准化产品研发,避免承接大量定制化项目,落地环节依靠生态伙伴完成,以此控制团队规模、保持迭代效率。

您认为具身行业需要什么样的人才?贵司人才培养和激励机制有什么特点?

王晓刚:我们非常看重复合型人才,尤其是硬件思维和 AI 思维结合的人才。团队里吸纳了很多年轻人做创新,也从商汤、车厂、互联网等不同领域引进人才,背景很多元。培养方向上,更倾向于让有硬件经验的人融入团队再学习 AI 能力,这条路更可行。

激励机制上,采用项目制激励,结合 KPI 和 OKR,核心是及时奖励、快速反馈。公司控制整体人员规模,但持续引进优质人才,内部保持良性竞争氛围。

您认为中美具身智能的发展路径有什么差异?中国未来的行业趋势是怎样的?

王晓刚:美国的路线以特斯拉、Figure AI 为代表,走的是高度垂直整合、拟人化路线,一家公司把硬件本体、模型、数据方案等全都做了,瞄准一两个核心场景打。

中国的路径不一样,是场景驱动的,行业也比较分散,不同公司负责不同要素,大家更关注在特定场景打穿,降低成本、提高效率。

未来趋势:国内掌握头部场景的企业会和具身公司深度结合;具身公司之间也会出现合并。中国场景丰富,利于模式复制,像零售、物流都是头部场景赛道。而且具身这个赛道不会像大模型时代赢者通吃——不是模型做得好就能收割所有市场,场景合作非常重要。

您怎么看不同场景下的具身公司发展模式?贵司做开源的核心动机是什么?

王晓刚:零售前置仓、仓储零售这类场景本身是容易复制的,但具身公司自己去做运营很难,因为很难自己把成本压下来,更好的模式就是和运营方合作。再比如自变量押注 C 端家庭场景、自己采集数据自己做模型,很难快速规模化,还是应该和头部企业合作,借助对方的人力快速攒数据。

关于开源:具身模型本质是面向 B 端的,不开源就只能自己用。开源一来奠定行业影响力,二来收集开发者反馈,加快迭代速度。不同公司开源目的不同—— Agibot 开源是因为需要开源模型让别人基于他们的本体做开发;我们开源是走 " 一脑多形 " 路线,对应多家机器人本体,主要为了收集市场反馈、加快技术迭代。

视觉输入直接映射为机器人动作输出,跳过了对物理世界的理解,导致每换一款机器人就要重新采集数据,成本高且不可持续。通过世界模型负责建立对物理世界(空间、物体属性、因果关系)的中间理解,再由大脑模组把这种理解转化为不同机器人的具体动作。这就像先学会 " 看懂世界 ",再学 " 怎么动手 "。

实现 " 一个大脑驱动多种机器人 ",听起来是模型能力的问题,但这背后是四个维度的系统性工程:空间对齐(统一坐标系)、物理形态对齐(统一结构描述)、时间对齐(统一动作节拍)、数据质量对齐(统一训练标准)。四项缺一不可。

在 AI 原生的组织内,传统职能团队保障硬件交付稳定性,平台型组织确保数据与算力资源全局共享,自下而上的创新项目制则为技术探索保留足够的灵活度。三层之间通过每周同步和成果共享紧密联动。

具身智能不会像大模型时代那样 " 谁的模型好谁就赢 "。中国的产业生态是场景驱动、分工协作的——掌握零售、物流等头部场景的产业巨头,和掌握世界模型技术的具身公司之间,将形成深度战略结合,而不是竞争关系。开源是这一生态逻辑的延伸,目的是通过更广泛的开发者使用获取多样化场景反馈,加速模型迭代。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 王晓 物理 ai 自动驾驶
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论