雷锋网 昨天
国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

具身智能的确定性技术还没出现,世界模型可能也不是答案。

    作者丨邓哲敏

    编辑丨齐铖湧

                                                                                                       

25 年 6 月,卢宗青在智源大会上提出一个判断:人类视频,是具身智能唯一可以 scale up 的数据路径。

彼时,行业的注意力集中在机器人本体、素材场搭建、数据飞轮上,没有多少模型公司把目光投向第一视角人类视频。卢宗青不一样,他不仅提出这个判断,而且按这个方向积累数据,到现在已经积累了超过  50 万小时

卢宗青是北京大学计算机学院长聘副教授,长期担任 ICML、NeurIPS、ICLR 高级领域主席,也是国内隐空间路线最早的系统性推进者

2025 年,他创立了 BeingBeyond 智在无界,走的是一条与主流视频生成路线截然不同的技术路径——隐空间世界动作模型(Latent World-Action Model):不生成画面,直接在 embedding space 里联合预测机器人下一步做什么、世界将如何响应。

这条路线训练成本是视频生成路线的约 1%,推理速度足以支撑实时控制,但有一个缺点——没有画面,不好展示。在具身智能融资热、demo 竞赛激烈的当下,这是一个需要定力才能坚持的选择。

不过卢宗青本人并不把这当成笃定的押注。

他在采访中说了一句话,让人意外:具身基础模型的确定性技术尚未出现,世界模型可能都不是。

他的逻辑是,GPT 能堆出来,是因为先有了 Transformer 和 Next Token Prediction,有了确定性范式,堆数据才有意义。具身现在还没到那一步,"我们现在连确定性技术是什么都不知道。"

这不是自谦,是判断。

26 年 7 月 28 日,BeingBeyond 正式发布 Being-H0.8 ——全球首个隐式触觉世界动作模型。Being-H0.8  首次将触觉模态引入大规模模型预训练,并将视觉、触觉、动作以及未来状态变化统一到同一隐空间(latent space)。这使机器人不仅能够理解 " 看到了什么、做了什么、接触到了什么 ",还能够进一步理解 " 世界因此发生了怎样的变化 ",从而形成对物理交互过程更加完整的认知与预测能力。

围绕技术路线的选择、数据的真实价值、行业分工如何形成,以及通用具身基础模型究竟还有多远的路要走,AI 科技评论(雷峰网 ( 公众号:雷峰网 ) 公众号)与卢宗青展开了对话,以下为未经改变原意的编辑整理:

01

从北大到创业:

纸上的东西不会自己变成产品

▎ AI 科技评论(雷峰网公众号):你是北大教授,做了多年学术,又出来做具身创业。今年我们看到很多高校老师出来创业,李一鸣、赵昊,包括您,感觉学术界出来的人今年特别多。你当时是怎么做这个决定的?

卢宗青:也不算突然转变。我本来就在研究具身相关的方向,只是到了某个节点,觉得这件事不能只停留在发论文。学术研究可以验证一个方向是否可行,但你判断完了,纸上的东西不会自己变成产品。

具身尤其如此,它需要真机去验证,需要真实场景去跑,需要在真实的物理世界里一遍遍失败再调整,这些事情在学校里做不了。创业是让研究落地的方式,不是切换赛道。

▎ AI 科技评论:我们观察到,今年出来创业的学者,有一部分明显有一种 " 不融就来不及了 " 的紧迫感,尤其是自动驾驶背景出来的人,对产业节奏特别敏感。你会有这种焦虑吗?

卢宗青:大家的目标不一样。对于我们来讲,我们的目标就是做模型,build up 具身的 foundation model。在学校的资源很难满足这件事,不管是算力、人员,还是产业生态,这些在学校里都很难。出来是因为想把这件事真正做成,而不是因为怕来不及。

当然,现在国内的资本市场,大部分其实比较短线。你看那些 Club Deal 的融资,前几轮基本不对外,头部机构来回倒,把估值炒到 5 亿美元,然后接盘侠来。他们相不相信具身、相不相信通用世界模型,我觉得他们也不一定真的相信。我们在筛选投资人,希望找到志同道合的、真正长期主义的机构。

▎ AI 科技评论:你提到 " 筛选投资人 ",这听起来有点奢侈。现在各家都在拼命抢钱,你反而在挑?

卢宗青:  如果你做的事情需要三到五年才能见真章,那你的钱也必须匹配这个周期。短期热钱进来,反而会扭曲你的技术决策。

02

隐空间 vs 像素:

一场成本差了 100 倍的赛跑

▎ AI 科技评论:最近我们跑了不少具身公司,发现一个有趣的现象——大家嘴上都说自己在做 " 世界模型 ",但路线差异很大。能不能先帮我们把这个概念厘清?

卢宗青:(笑)世界模型本来就是个没有收敛的概念,脱离语境来谈,它就是一个模糊的词。

世界模型,它不是一个模型,最终要落在某一个领域里面。语言领域,语言模型就是世界模型,这在学术上已经被证明过—— 2024 年 ICLR 的 best paper,MIT 的一篇论文。李飞飞团队做的 3D 生成,在那个场景下它也是世界模型。视频生成模型也说自己是世界模型。没有一个模型,现在能同时输出文本、生成 3D 空间、生成视频、还能控制机器人。

对于具身来讲,我们要控制输入输出动作,那具身基础模型就是具身领域的世界模型。我们在做的,就是这个范畴里的事。

▎ AI 科技评论:在具身这个范畴里,路线分歧还是很大。李飞飞有她自己的分法,英伟达的 Cosmos 又是另一套框架。你怎么理解具身内部的技术路线划分?

卢宗青:从 backbone 来分,大体两类。一类基于视频生成模型,在原有能力上做后训练,生成视频的同时输出 action;另一类不生成画面,直接在 embedding space 里预测接下来的状态和动作。

李飞飞的分法不太一样,她更多从用途角度划——生成 3D 空间的渲染类,做 simulation 的交互类,还有一类就是控制机器人的,英伟达的 Cosmos Policy 就是这个方向。

各人分法不同,但对于我们来讲,更关心的是 backbone 选什么,因为它决定了训练成本、部署速度,以及最终能不能跑在真机上。

▎ AI 科技评论:我们看视频生成路线的 demo 确实更震撼,更容易讲故事,但强如阿里 Wan 也传出团队解散消息,这是一条很难的路吗?

卢宗青:视频生成路线有两个问题。

第一,训练成本极高。预测每一个 pixel,大型视频生成模型的预训练可能需要几万张卡、几个月,整体成本达到几个亿。阿里 Wan 团队遇到了问题,那个模型停在 2.2,撑不下去了。

第二,真机跑不起来。机器人需要实时决策,推理速度要极快。你得判断球的飞行轨迹、实时输出抓取动作,画面还没生成完,时机已经过了。

我们这条路线(隐空间)有两个优势是可以量化的。

一是训练成本,假设数据量和参数量相同,仅算力层面, latent space 预测的成本大概是像素空间生成模型的 1%,差了两个数量级。

二是更容易学到物理规律,监督信号定义在 pixel 层面,模型会被拉着去预测画面;在 embedding space 里,你也不知道那个空间到底是什么,反而有机会学到更本质的物理关系和因果关系。

▎ AI 科技评论:可隐空间没有画面,不好展示。在现在这个融资热、Demo 竞赛激烈的当下,你们是不是吃了大亏?

卢宗青:  演示和落地是两回事。一个接不住球的机器人,画面再好看也没用。隐空间确实不好展示,没有画面可以给别人看,这是现实,我们也接受。

但换个角度,离产业近、目标明确,这是投资人更看重的东西。目标明确意味着你知道自己在解决什么问题,而不是用漂亮的视频去掩盖模型在物理交互上的无能。

▎ AI 科技评论:你觉得现在行业里那些炫目的操作视频,有多少是 " 应试 "?

卢宗青:  你看到的可能是上千次里最好的一次。这不是秘密。

03

数据这件事,比所有人都早两年

▎ AI 科技评论:说到数据,现在行业有一种很流行的观点:谁攒下来的数据多,谁就有优势。我们最近采了一圈,发现大家都在自建数采中心,搭采集流水线,你当时是怎么判断人类第一视角视频这条路的?

卢宗青:这个判断  2023 年 11 月我就提了。(深度机智于 2025 年 5 月注册,是国内因为做人类第一视角数据而被广泛报道的公司,卢宗青的判断比他们早了将近两年。)

逻辑其实不复杂。机器人本体采集的数据,天然有两个问题:量上不去,多样性不够。你在一个数采场里能 set up 多少种场景?Simulation 也一样,你得让工程师把环境一个个构建出来,多样性极差。训练一个通用的基础模型,最重要的数据属性是多样性。那当时就看—— simulator、真机数据、人类视频,只有人类在日常生活里完成各种任务的第一视角视频,是三点同时满足的:多样性高、数据量大、容易 scale up。就那么几种数据,没得选。

▎ AI 科技评论:现在攒了多少数据?我们之前看到说是 20 万小时。

卢宗青: ( 智在无界在 7 月 28 日发布了最新的 Being-H0.8 ) 现在已经超过   50 万小时。这不是堆时长,每一个小时都是按多样性和质量标准筛出来的。重复数据对我们来讲没有意义。市场上存量数据能到 100 万小时的公司都很少,有人说 1000 万小时,那是目标,不是现有。

▎ AI 科技评论:很多本体公司讲 " 数据飞轮 ",先把设备铺到用户家里,一边用一边采,用量产驱动数据积累。比如让用户戴着采集设备做家务。你觉得靠谱吗?

卢宗青:  这件事最大的优势方是平台公司,不是创业公司。

如果是一个创业公司去干,它会 overfit 自己的本体,数据仅仅耦合自己的构型,能积累多少?短时间之内不可能 scale up。我们希望看到的数据是足够通用、diverse 的,不仅仅针对某一种构型。这个事情,从头到尾做完,不是一个创业公司该去揽的活儿。

▎ AI 科技评论:所以你认为现在所谓的 " 数据飞轮 ",对大部分初创公司来说是个伪命题?

卢宗青:  对于想走通用基础模型路线的公司来说,是的。如果你只是想 overfit 几个场景卖本体,那没问题。但如果你想通向 AGI,仅靠自家本体的闭环数据,天花板是看得见的。

▎ AI 科技评论:你们 50 万小时和别人自建数采场采的数据,差距到底在哪里?

卢宗青:你要训练一个通用的基础模型,要见过各种各样的场景,操作各种各样的物品,完成各种各样的任务。建立一个数采场,能 set up 的场景有多少?

Build up 这 50 万小时,需要一个强大的数据基础设施——标注、筛选、数据对齐、评测、数据管理,这些都需要花时间,是有门槛、有壁垒的。而且外界可能感知不到,这也是我们的模型能够快速迭代——从 0.5、0.7 到现在推进 0.8 ——的最主要因素之一。智在无界已完成从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施建设。这套体系能够推动规模化数据持续沉淀、模型能力持续进化,并让机器人不断走向开放、复杂的真实物理世界。

04

" 什么是确定性技术?我们现在还不知道 "

▎ AI 科技评论:我们观察到,很多公司都是先采真机数据、做 SFT,快速做出一个场景能用的模型,然后拿去卖本体公司。一些量级很大的公司也在这么干。你怎么看这条路?

卢宗青:天花板太低。后训练这件事,大家的能力其实差不多。200 亿估值的公司和初创公司,单场景表现拉不开差距。真正的差距在预训练模型。好的预训练模型可以把下游真机数据需求降低一个数量级,可以快速适配不同场景,可以通向终极目标。Being-H0.5 可以适配双足人形、双臂、机械臂、夹爪、灵巧手,在一种构型上采集数据微调后,完全不同构型的机器人也能做出类似动作。这是预训练模型的价值,是后训练堆不出来的。

▎ AI 科技评论:说到本体,各家对灵巧手的看法差异很大。有人认为 Sharpa 做得好,但 5 万美元一只;有些产品便宜,能力又被诟病。你怎么看灵巧手这个市场现在的状态?

卢宗青:这是产品选择的问题。5 万美元的手,你只能卖给有钱的科研机构,一般高校怎么可能花 30 万买一只手?市场非常非常小。几千块的手,量是更大,但大家说的量产降本逻辑——比如激光雷达那条路——那是要有大量的真实需求拉动的。

大量的需求现在卡在哪里?卡在具身的模型侧。光有一只手,没有模型驱动,什么都干不了。在模型没有突破之前,靠量降本是不可能的。

▎ AI 科技评论:那你们自己怎么定位?做四足、人形,还是什么方向?

卢宗青:不做四足,专注操作类——人形机器人、机械臂、灵巧手。我们现在和地瓜机器人合作做端侧世界模型的部署,本体公司是我们的客户

我在年初就判断,具身一定会形成产业链分工,不可能由一家公司把所有事情都做完。链条太长,技术没有收敛,模型没收敛,硬件也没收敛。专业的公司做专业的事,整个行业才能更快发展。

▎ AI 科技评论:我们注意到一个现象,现在很多机器人公司也在做研究,比如往顶会塞论文?

卢宗青:  用论文来吸引人才无可厚非。我们在 RSS、ICML 这些会议上都有大量的论文,但我们不会为了发论文而做研究。但核心工作不能都停留在 paper 上,模型在真机上跑很重要。

▎ AI 科技评论:你怎么定义自己在世界模型领域的生态位?

卢宗青:  我们应该是国内最早系统性推进隐空间世界动作模型路线的团队。但这个领域变化太快了,今天的 " 最早押注者 ",明天可能就是落伍者。保持敬畏吧。

▎ AI 科技评论:你对行业整体节奏怎么判断?

卢宗青:两到三年,行业会看到真正商业化的落地。不是为了冲业绩收入、为了上市讲故事的那种,是能算 ROI、真的产生商业价值的场景。三到五年,能不能做出类似 GPT 3.5 阶段的具身基础模型,在不同形态、不同场景下完成各种任务,不需要大量场景适配。这个 milestone 才能带来真正的家庭机器人,商业价值比前一阶段大得多。

▎ AI 科技评论:5 年目标,最关键的赛点在哪里?我们听很多人说数据、说算法,各说各的。你真实的判断是什么?

卢宗青:不能脱离数据说模型,也不能脱离模型说数据。GPT 之所以能堆出来,是因为先有了 Transformer,有了 Next Token Prediction。有了确定性的技术范式,堆数据才有意义。没有这两个,光堆那么多数据也没用。

具身智能是同样的逻辑。问题在于,我们现在连确定性技术是什么都不知道。我们现在说的这些,包括世界模型,可能都不是。所以未来三到五年,不只是积累数据,训练方法和算法本身也需要比较大的突破。

▎ AI 科技评论:你给模型命名 H0.7、H0.8,心里有一个 1.0 吗?

卢宗青:(笑)有。1.0 代表的是一个真正完善、通用的具身基础模型。这是一个探索性的过程,路还没走完。但是 Being-H0.8 代表着一个重要节点,不仅是从视觉到触觉,从观察世界到理解交互的模型能力进化,更预示着一个同时具备视觉理解、触觉交互、动作生成、世界预测、跨本体泛化的具身基础模型即将诞生。我们正在迈向全新的1.0时代。接下来,智在无界将以前所未有的训练范式,加速通用具身基础模型的到来。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 北京大学 竞赛 物理 融资
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论