财经涂鸦 4小时前
蚂蚁灵波朱兴谈具身数据:分布是模型厂商核心knowhow
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

"数据过剩后,如何拿到想要的数据非常关键,量不是问题。"

出品:财经涂鸦(ID:caijingtuya)

" 相比单一规模,我们更重视数据本身的质量分布,因为场景过度重复的数据意义不大。所以现在大家更多在谈论 coner case。因为数据过剩之后,如何拿到想要的数据非常关键,量不是问题。"

公司情报专家《财经涂鸦》获悉,9 月 11 日,蚂蚁灵波 CEO 朱兴在 2026 inclusion · 外滩大会期间针对具身数据的采集方式、需求方与数采方的分工、高质量数据如何评判等问题进行了分享。

模型训练方「有义务定义数据需求」

谈及目前数采过程及交付结果存在的问题,朱兴透露,数据需求由模型训练方定义,这是研发过程中非常核心的 knowhow。

" 在灵波,我们会主动想数采服务商定义需要什么类型的数据、什么样的分布,分布涵盖什么场景、哪些任务等等。有些采集难度比较高的数据需要先试采,帮它产生比较好的 SOP,然后再推给相关的供应商帮我们上量。"

他坦言,成品数据确实有些问题,比如技术质量差、大量重复等,导致漏斗率很低。

因此,去年早些时间,灵波就已不太采买成品数据,并主动过渡到定制化采集为主,与供应商在 SOP、端到端数据管线的自动化集成等很多方面进行积极探索。

" 我们较早实现了从原始数据到模型训练的数据漏斗,过去一年多时间,可用率从 15% 左右迅速拉到 90% 以上。同时,我们也特别关注从数据生产到能够进入模型训练的时间,比如一周还是三天。这其中花费了很大力气。"

目前,灵波的数据交付一般都是流式交付,而非批量交付。

他同时指出,定义所需数据的种类和质量是数据需求方的 " 义务 "," 不能把这件事情赖到数采厂,这是良性化 "。而数据供应商需要做的是做好执行。

" 比如,我们要求采 5 个小时抓药瓶的数据,其中要明确数量是 20 条,采的过程中轨迹要好一点、平滑一点,稍微带一点泛化性。这些数采厂要做好的事情。"

数据服务商将出现明显「分化」

但他认为,完全放弃数采商该用自建数采厂也无必要。

一方面,好的数据供应商仍然非常有价值。比如,它们有比较专业的大规模用工能力,当你管理非常多的生产员时,可以借鉴如何进行考核和激励;同时它们的产能具备一定弹性。" 至少灵波不擅长这些,我们也不想把自己搞那么复杂。"

另一方面,未来数据要进到更多场景,数采厂商对场景运营也更有经验。

针对行业中 " 万小时 " 的数采衡量标准,朱兴认为,从数据的角度讲,比量更重要的其他维度要更多,比如分布和质量。

" 我知道大家特别想大力出奇迹,寄希望于怼到多少小时智能就会涌现、爆发,并迎来具身智能新时代。但实际没有这么简单。"

鉴于目前数据采集过程中仍在产生大量高度重复的数据,朱兴认为,再往前走,数采行业可能会更加分化。

" 首先,从设备的角度讲,数采厂能否把量产工艺控制好非常关键,拼的是内功。比如大家都做头环,但是你的量产工艺好不好呢?其次,数据服务商未来会逐渐分两类,一类以人力服务为主,没什么门槛。"

还有一类会跟基模厂商配合," 这其中考验的是数据服务商能否沉淀更多自己的 knowhow,能否提升场景采集侧的数据管线能力,以及能否跟数据消费方更高效地配合。因为所有技术升级的背后都是效率提升,本质是成本的竞争。

关于数采标准,他表示,行业层面的标准肯定会更加收敛,同时模型厂商内部也会有自己的标准,比如灵波内部就有一些 " 金标 "。

灵波对于具身数据的几个判断

" 我也相信 Scaling Law,但背后的数据不能机械地看量。现在具身模型领域已经出现这个现象了,比如用多少小时来衡量。但我们同时会发现,有时候 A 模型数据需求量比 B 模型大 3、5 倍,但效果更差。"

而有些小数据量模型在某些类型的场景任务上却表现得特别好,背后的根本原因是数据分布不均衡。

朱兴同时分享了灵波对于数据的几个判断。

第一,数据量很重要,但不能只谈量,更要谈背后的质量和分布。" 尤其是分布,又是模型厂商最核心的 knowhow。

" 大家老说‘炼丹’,背后就是(数据的)配方。类比自动驾驶可见,现在每天收上来的大部分数据,唯一意义是增加存储成本。"

第二,每种数据都有阶段性价值。

" 仿真数据有没有价值?有价值,但更多在中后训练阶段。尤其是特定任务中需要强化、拉成功率的时候。但仿真在预训练阶段怎么可能发挥很大的价值呢?如果它能够在预训练中生成那么多高质量语料,说明仿真的能力已经可以控机器人,不需要再搞模型了。"

第三,不要轻易谈不同数据源之间的数据配比。

" 别人经常问我,你们有没有用互联网(数据)?我说肯定要用。但谈数据配比就没有意义了。大几百万的互联网视频操作数据配一点点真机数据,肯定会出现淹没。"

他进一步指出,灵波的做法是,把大的动作模型分几个训练阶段,包括预训练、中训练、后训练。预训练的数据主要指向场景泛化,比如无本体数据、互联网视频数据等,因为能够更好地 Scaling。

后训练更偏向某一个具体场景和任务," 在这个阶段,我们需要把成功率拉上去,所以越贴近机器人的数据越能发挥价值。这也是为什么落地之前会再做一把数采,根本原因就是让模型更熟悉机器人本身的构型、具体的任务和环境 "。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论