投中网 22小时前
顶级VC连投4轮,刘松铭又融数亿
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

" 做通往物理 AGI 难而正确的事情。"

我在 6 月报道过的 LiberAI 今日宣布完成新一轮数亿元 Pre-A+ 轮融资,投资方包括 360 战投、国开金融、创新工场、CMC 资本、彬复资本等,老股东红杉中国自天使轮连续追加四轮。三个月内,LiberAI 已获得红杉中国、真格基金、美团龙珠、顺为资本等顶级机构的连续押注。上半年,世界模型赛道上新公司层出不穷,大有 " 乱花渐欲迷人眼 " 的意思。进入下半年,资金将向头部项目聚拢,只讲故事怕是已经不行,还得拿出扎实的业务进展来。上回,《独家 | 顶级 VC 连投三轮,00 后清华特奖得主又融数亿》介绍过刘松铭的创业历程和 LiberAI 在技术路线上的选择——模型上重注原生多模态的预训练,同时构建自己的数采和硬件体系。这次,我着重跟他聊了聊预训练、人类数据与灵巧手这件事的重要性以及自研人类数据手套的进展。这位 00 后创始人相信,预训练是智能产生的根源,世界模型本质上是多模态模型的延伸,关键在于引入物理模态后怎么把多模态的方法论落实。具体到人类数据,他认为文本、视频、物理三个模态必须在隐空间对齐,才能解决灵巧手在高维空间上的采样与决策难题。谈及进展和规划,刘松铭透露,LiberAI 在高自由度灵巧手上从模型训练到部署的整个环节都已经跑通,自研的人类数据手套也已进入量产阶段。到今年年底,公司会着力推进两件事:其一,是把人类数据这件事彻底跑通,跑出人类数据的预训练 Scaling Law,在泛化性上实现涌现,由此可以不再依赖仿真和真机数据,让人类数据成为最核心的支柱。

" 做夹爪,你早期 100 小时、1000 小时就能出不错的 demo,每一步都能用。我们做灵巧手,在复现人类智能之前会有一段‘沉默期’,风险确实更高。但一旦爬上去,你能链接所有人类数据和互联网视频,upside 巨大。" 这是刘松铭的 bet。其二,在模型架构上,LiberAI 想做兼具 agent 能力的世界模型。这不再是单点任务的模型,而是能做推理的模型,如同 "physical 版的 Claude" 一样,在真实世界中进行任务规划、推理、执行与纠错。夹爪还是灵巧手具身行业兴起两三年了,在数据采集的方式和模型的技术路线上,分歧和非共识却一直都在。Generalist AI 在 7 月刚刚公布了模型的一项新能力——同一个预训练模型可以驱动五花八门的末端执行器,除了常见的夹爪,还有电动螺丝刀和打蛋器这类专用工具。跨本体的能力令人惊艳,不过它明确表示不看好五指灵巧手路线,认为机器人的手不会长得像人手。" 五指手只是工具箱里的一件,把机器人限制在这一种形态是想象力的失败。"Generalist AI 在博客文章里表达了鲜明的态度。在末端执行器的选择上,刘松铭有着截然不同的看法。他认为,只要把人类智能完整蒸馏出来,这种智能天然具备适应不同本体的能力。和 Generalist AI 恰恰相反,LiberAI 没做过任何夹爪,而是聚焦在灵巧手算法和人类数据的采集与预训练上。数据采集时,到底是 " 让人模仿机器人 " 还是 " 让机器人模仿人 ",在刘松铭看来是个哲学层面的问题。前者对应的是用遥操、UMI 夹爪和外骨骼等方式收集数据,后者对应的是用数采手套收集人类数据。" 有一种思路是让人去模仿机器人,认为这样收集出来的数据才能从人迁移到机器人上。但我们的思路恰恰相反:让人尽可能保持人的特性,追求无感采集。这样做的代价是人与机器人之间短期内的 gap 可能会变大,但优势在于天花板更高,运维成本低,更容易 scale up。" 刘松铭这样分析选择里的取舍。当然,从算法实现上来说,夹爪和灵巧手完全不是同一个层级的难度。举例来说,夹爪只有一个自由度,状态空间是离散的 0 和 1,控制简单、算法难度小,短期就能出 demo。LiberAI 部署的灵巧手有 20 个自由度,观测、数据采样、底层 Infra 和一些细节的控制上都更困难。可部署于高自由度灵巧手的模型研发是公认的难啃的硬骨头,但在刘松铭眼中很有意义。" 这就像在爬雪山,如果你接受这种难度,一旦登顶,优势巨大,能链接所有人类智能。夹爪路线我们最早已经验证过,从夹爪泛化到灵巧手很难,但我们的模型从灵巧手迁移到夹爪很容易,终局我们也更坚信目前选择的人类数据与灵巧手路线。" 支撑这一判断的逻辑是:既然终极目标是让机器人具备人类级别的通用操作能力,那么人类数据就是不可替代的 " 石油 "。人类数据天然产生于灵巧操作之中,夹爪数据再多,也无法和人类视频完成对齐,难以 scale up 到通用智能。" 不可能三角 " 和数据金字塔为了实现这一目标,LiberAI 主要做了三方面的工作:一是数据基建与工程算法,包括整个数据 pipeline 的搭建——如何清洗数据、逐帧切割互联网视频、从中检测出手部并优化手部检测算子的速度,从而快速切分出手部数据。整个链路要执行得快,切分边界也要清晰,比如喝水动作中,何时抓杯子、何时拧瓶盖,都要能从视频中准确识别并切分。目前这套 data infra 和数据管线已完全体系化,自动化率在 90% 以上,基本通过 API 和自研微调模型完成自动打标,而且管线本身是 agent 在监控和优化,会越标越聪明。二是模型本身的训练。关键在于提升模型能力,使其能在复杂空间上高效采样。文本、视频、灵巧手动作,这三个模态需要对齐到同一个隐空间中采样,才能提升对手部的感知、采样和控制效率。LiberAI 团队已经做了大量 human data 和多模态训练,将它们对齐到统一空间。要让这条路线跑通,还要攻克数采手套的 " 不可能三角 ":高精度、可穿戴性、抗电磁干扰且抗遮挡。刘松铭介绍,LiberAI 自研人类数据手套已攻克以上不可能三角,进入量产阶段及规模化 in the wild 采集阶段。每家具身公司都有自己的数据 recipe,如今数据类型已经大体上收敛到互联网视频、真机遥操、UMI、人类数据等几种,但不同企业的配比仍有差异。在 LiberAI 的数据金字塔里,第一视角和第三视角的互联网人类视频数据占据绝对塔基,比手套数据大 1-2 个数量级;手套数据次之,比真机数据大 1-2 个数量级;真机数据最少。这家公司的愿景是,人类数据可以成为最重要的支柱,不用再高度依赖成本高且规模受限的真机数据。这是一个看上去颇为激进的赌注。要知道,去年行业里的主流说法仍是通过遥操采集真机数据。这家公司也正在尝试将数据采集团队与 agent 系统深度结合在一起。比如,当模型推理发现 " 叠衣服强、收垃圾弱 ",agent 会自动发布任务,调度更多人去采收垃圾数据。用 AI 管理 AI 的数据,听上去很酷,这是 AI for AI 时代全新的组织思路。灵巧手和数采之外,我们还聊了聊行业竞争和企业文化,以下是我们的部分对话内容。刘燕秋:灵巧手这么难,行业里不少人选择放弃五指,去做二指或夹爪。你为什么坚持一定要做五指灵巧手的算法?刘松铭:这是一个短期和长期的问题。做夹爪,你早期 100 小时、1000 小时就能出不错的 demo,每一步都能用。我们做灵巧手,在复现人类智能之前会有一段 " 沉默期 ",风险确实更高。但一旦爬上去,你能链接所有人类数据和互联网视频,upside 巨大。从第一性原理来看,我们更愿意追求难而正确的事情。刘燕秋:你说的 " 杀死真机后训练 " 是什么意思?刘松铭:我们前面说,一方面是拥有足够的人类智能;另一方面,自研本体,可以设计得更接近人本身。目标是不需要采真机数据,直接做迁移,从而根本上克服真机数据成本高、难以规模化的问题。目前我们仿人本体已启动量产,硬件的 OS 系统是用 agent 的方式来做。之前硬件坏了,需要人去排查,现在用 agent 帮你做这部分工作,它可以自行排查哪里损坏,甚至帮你做客服,使用更加便捷。我们现在把这一套都让 agent 接进来,随着它见到的各种错误、交互越来越多,它会越来越聪明。刘燕秋:这个思路听上去挺 AI native 的。刘松铭:对,我们也是用新的思路来做,用 AI 的思路在做硬件。前面提到的数据管线是一个 agent,本身是个生命体,会去监控 pipeline 里面出现了什么问题。因为我们现在 90% 的自动化率,总会有些 agent 覆盖不到。它能自己去总结和概括覆盖不到的问题是什么,再去迭代它自己的模型和算法。我觉得这是 AI for AI 的思路,把它自己做成一个 self-improvement 的 system。包括数采环节,一方面跟外包商合作,另一方面整个管理系统 agent 化。任务的下发、核实、简单的沟通和客服,都用 agent 来做。数据采完之后去训模型,模型再推理,它会去看模型推理的整个效果,然后反过来去改发布的任务。比如说你发现模型叠衣服非常厉害,收垃圾比较差,那么它就会去发布任务,让更多的人去采收垃圾的数据。刘燕秋:作为新一代的具身公司,怎么看更早成立的公司?如果出现新的技术和数采路线,更早成立的具身公司不一定有先发优势?刘松铭:假设你采了五万、十万小时的夹爪数据,现在要做灵巧手,这些数据怎么办呢?再比如,你进家庭采遥操数据,要搭运营体系、货拉拉调度,还要维修工程师跟着。假如现在不采遥操了,那个体系还要不要?确实存在一些现实的问题。很多体量更大的公司内部同时跑多条路线,难以押注在某一条,这恰恰是不自信。初创公司必须 focus 和快速迭代,创始人一天就 24 小时,同时开几条路线,可能哪条都赶不上。刘燕秋:那你不担心 all in 这一条路线万一赌错了?刘松铭:第一,这是基于第一性原理的推导,最早我做的具身基础模型预训练 papar 及无本体数据 scaling 效果验证了我们的能力,我也看到了过往路线的局限性;第二,我们也在持续逐步验证,在过程里更坚信我目前选择的道路,我从去年年中就坚持押注的这条道路,而如今也在逐步脱离非共识。刘燕秋:但先发者毕竟有技术和数据积累,完全无法融合到新路径里吗?刘松铭:知行合一非常关键。历史路径依赖强,招的人可能存在匹配性问题。很多公司从其他领域招人,但我们发现最 match 的人要么是很年轻的具身研究者,要么是做视频、做多模态的。组织大了,不匹配的背景会成为包袱影响迭代速度。一批先发者目前主要任务也许更多是冲刺上市,第一性角度的目标和我们不一致。我们的赌注是去冲刺 AGI 的到来,更加纯粹,更加专注,轻装上阵,快速迭代,斜率更陡峭。刘燕秋:你赌一到两年时间内有突破,依据是什么呢?刘松铭:依据是我们觉得现在已经解决了数据的问题,剩下大模型的发展会非常快。从原理上来说,这个问题还是个多模态的问题。既然是个多模态的问题,就有多模态的解法,而且多模态已经被证明在很多领域内都成功,这个领域也不例外。刘燕秋:现在和国外的顶尖具身公司相比,你们的差距和跨度是什么?刘松铭:我觉得模型上差距不大,因为我们最新的还没有发,我们自己看到的涌现,已经是跟硅谷同一个起跑线,大家是并肩赛跑。国内理应硬件上更领先,但因为种种原因,很多还停留在遥操的时代。刘燕秋:你是 00 后,投资人会不会关注你的管理能力?刘松铭:投资人问了很多跟文化、管理有关的问题。我的回答核心是三点:利益、信息、价值观。利益上,公司是个同心圆,以愿景和业务为核心,从 CEO 到高管再到基层,分配要 fair,每个人都从公司的发展中获益。信息上,我们高度 align,我自己也会写 memo 内部分享思考。我觉得写作比语言沟通更深刻、不带情绪。价值观上,我们推崇谦逊、有同理心,考察候选人是否足够开放,愿意放下 ego 与他人协作。我们始终 one team,one goal,反对山头文化。我们不会刻意筛掉没有光鲜履历的人,更看重是否有 direct evidence,来证明具备工程化能力。这也是我们企业文化里很核心的一部分。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

红杉 龙珠 物理 天使轮 清华
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论