"近一个月已交付 200 万台机器,部分国外客户套利空间单人单月可达 1-2 万元。"
作者:苏打
编辑:tuya
出品:财经涂鸦(ID:caijingtuya)

伴随模型能力持续增长,具身智能瓶颈正从 " 算法是否可行 " 转向 " 真实交互数据是否充足 "。
公司情报专家《财经涂鸦》获悉,近日,由中关村海淀具身智能产业园举办的具身数据专场闭门交流会举行。活动面向具身智能产业上下游,邀请来自异构数据、真机远程控制和具身大模型等不同方向的企业代表,共同讨论数据生产、模型训练与真实场景部署等产业议题。
现场,灵御智能 CEO 金戈以《真实世界,如何成为具身智能与世界模型的数据底座》为主题,从真机遥操数据、质量标准到分布式数据生态,分享了灵御对下一阶段数据基础设施的判断与实践。
他认为,越是开放的生态,越能涌现高质量的模型," 没必要每个人都去卷仿真模型。我们更希望提供高质量的数据,去帮助仿真模型公司做出好的模型,完成真机在场景内的部署以及数据的回流。"
以下为金戈演讲内容精编:
物理智能现在正面临数据极度稀缺的问题。在解决这一问题的过程中,我们把自己定义为 " 真机方向的基础设施 ",包括真机的本体、真机相关数据,以及可以部署的完整网络。这个完整网络使得我们的真机可以是一身多脑的,其实刚才鲍总讲到生态,我们是非常认可的。
互联网智能、道路智能(自动驾驶)的最大优势就是数据不缺。比如自动驾驶,数据的获取成本非常低。自 Tesla Model 3 出来后,包括小鹏、理想、蔚来等在内,数据的采集方已变成了每一个车主。
自动驾驶其实是从数字世界向物理世界过度的一个中间态。它已经开始和物理世界有关联,但并没有与物理世界形成交互。因为自动驾驶的核心目标是 " 避免交互 "——车在马路上开,不能碰到任何东西。
而从具身和物理智能开始,我们需要和物理世界进行交互了。但关于物体特性的数据在人类历史上从没被记录过,因此,这些交互模态的数据变成了今天物理智能最大的问题。
在数采这条路上,大家正在用不同的方式解决问题。
传统的真机遥操数据在保真度和模态上确实有优势,但目前成本是一个巨大劣势,通常每小时超过 500 元。即便如此,其在单小时的有效工作条数仍旧不如异构和用例数据。
扩大数据规模是非常必要的,但规模化供给的关键是持续提升成本效率,所以我们的方案是把真机数据成本降下来,降至每小时百元以内,从而实现高保真和高成本率的双目标。但从长远看,我们更希望未来实现如自动驾驶一样的零成本采集,从而最终实现通用智能。
可训练数据必须包含完整任务闭环,并以模型团队可直接使用的标准数据包交付,因此我们做了一套完整的工具链,包括任务定义、多模态感知、动作与接触、过程语义、失败与接管、结果与验收等,能直接交付一个可用的模型和资产包。截至目前,我们也已经交付了很多模型客户。
谈到真机数据,大家可能都会有一个问题,它的能力是不是太菜了?我们经常看到机器人在被遥操的时候工作又慢又笨,又不准确。
高质量示范必须同时满足快、准、稳三个条件,分别对应路径高效、过程准确、连续可靠,缺少任何一个都会把低效或不稳定的行为教给模型。而且如果遥操机器人的工作速度和工作质量不高,没有人会用它替代人。
刚刚结束的人工智能创新大赛中,我们以极高的分数获得了冠军,15 分钟内完成了 270 多件分拣,100 多件工件装配,几十件搬箱子。截至目前,我们真机采集的数据至少在动作质量方面是最高的,且成本压得比较低,机器售价每台 10-15 万元,在市场上很受欢迎。
数据质量方面,我们现在可以做到所有传感器间实现亚微秒级时间戳对齐,这对于今天的隐空间形态的世界模型非常重要。目前,我们跟很多世界模型公司在合作,他们非常强调多模态数据之间的因果推理,即力觉和触觉发生变化与画面发生变化之间的关系。
同时,空间精度上也要对齐。我们已实现坐标标定一致,机器人的空间精度能达到 1 毫米级别。同一个机型中,A 机采的数据训的模型能否在 B 机很好地执行,其中就涉及到绝对空间定位精度,当然还包括任务的有效边界、成功的边界、失败的边界、训练可用等。
最后,我们还能提供一个非常重要的点,就是真机可验,即关键轨迹能够回放、复现,并接受真实机器人结果验收。目前,我们的机器在京东超市已经持续工作超一个月,回流了多样化的不同场景的数据。顺利的话,10 月份会进入北京更多超市。我们计划未来三个月在 5 到 10 家店逐步铺下去,进行常态化部署。
我们认为,最低成本的数采方法,是让作业过程本身就变成持续负载的过程。
目前,我们在国内提供的路径是,比如让部分欠发达地区的人去操控机器人,让机器人在发达地区工作,其中套利空间可达 4000 元左右。双班倒机制下,单月双班套利空间大约为 8000 元。按照我们的机器每台 10 万到 15 万元计算,一个客户仅从这部分节约的成本就能做到单年回本。
一些美国和新加坡的客户,劳动力的套利空间更大,单人单月可达 1-2 万元。如果操作人员更换成墨西哥、东南亚人,成本差异会更大。
这个过程中,商业可行的低成本数据回流就变成了一个我们可用的方案,而且会自然暴露一些长尾问题。
我们设计了一个 TA Nexus 平台,可以把采集、遥操、训练、验证和部署接在同一条数据链路上,实现边工作边采集边回流。通过这个神经网络,我们可以实现跨区域遥操,覆盖欧洲、中国、美国等全球区域。在该网络上,所有认证的机器可以从地球上任何一个点去操作另一个点的机器人。
同时,我们还做了云端部署,可接入不同任务模型与客户自研模型,用云端模型去驱动机器人工作,相当于自动驾驶 L2 的人机混驾的状态——模型可以工作的时候就让模型工作,模型出了问题,比如置信区间下降,再转由人类接管。
这个过程中,人类接管的数据都是高质量的 case 数据,自然暴露长尾,自动回流到我们的云端平台。在云端平台上,我们还做了训练部署的一系列回流,使得我们能够真正把采集、遥操、训练、验证、部署完全接到同一个链路里面。
目前这个生态中,我们把自己定义为一个合作伙伴、一个中间的链接节点。最近一个月,我们大概交付了近 200 万台机器给国内各种各样的数采厂和场景客户。
运营模式也发生了改变,我们不是先生产再找买家,而是先定义需求再组织生产,把数采场变成面向模型订单的数据 " 种植基地 "。只有由模型需求牵引的订单式生产,才能同时控制数据有效性、交付周期与生态协作效率。
现在我们已经能够把数据仓库做成一个相对标准的产品;中期希望能形成一个分布式的供给网络,把我们的自营中心、数采厂和真实场景都连接起来,扩大本体覆盖范围。
但长期来看,我们还是希望能进入人机协同的混合智能。因此,我们规划的落点不是一张静态数据集,而是模型自主执行、人类处理长尾、系统持续学习的 Human-in-the-loop 基础设施。
我们也希望和产业伙伴一起,把高质量真机数据从一次性交付,建设成长期演进的行业基础设施,让真实世界成为具身智能与世界模型可学习、可验证、可复用的数据资产。
本文由公众号财经涂鸦(ID:caijingtuya)原创撰写,如需转载请联系涂鸦君。
添加涂鸦君个人微信(ID:tuyaclub)
加入【公司情报社群】
参与资本市场讨论
获取一手情报


登录后才可以发布评论哦
打开小程序可以发布评论哦