9 月 10 日,一家刚上市的具身智能公司创始人,乘着公司刚上市便大跌的火气,在朋友圈实名吐槽具身智能行业中存在攒局型企业。
他提到行业存在做虚假的、不可持续的收入,没有 PMF,只会发布各种大新闻炒作,成立两三年就要上市的风气。
在此之前,这位创始人就曾公开表达过,具身行业缺乏数据的情况下,有公司通过数采中心渠道获取收入的问题,如地方投资建设数采中心,并购买具身智能公司的设备,然后公司回购数据,从而形成账面收入。
当某个行业处于水大鱼大的情况下,一定有花里胡哨的活法。原因是行业刚刚爆发时,鲜有公司能跑通 PMF,在交付之前的真空期,很少有公司能耐得住性子,踏实做事。
放到具身智能行业,表现为数据稀缺,需求紧迫,所以得有奇技淫巧。
同一天的杭州,高德办了一场发布会,展示了另一种数据生意的玩法。过去一年,8.8 亿用户在高德浏览榜单、评论与评分,用户为上榜商家累计导航 366 亿公里,1528 万人报名参加侦探创作者计划,838 万人完成支付宝信用授权,留下近 5000 万条真实评价。
高德扫街榜建立起了一套低成本的数据采集渠道,也无需支付数据授权费,从采集到回流的过程,在使用中已经完成。
具身智能公司为数据花钱,花出了财务问题。高德积累起的 366 亿公里的成本,要低得多。
一年建成数采网
去年 9 月 10 日,高德发布扫街榜,对外口径是解决虚假评分、虚假评论。
CEO 郭宁发布会上重述了当时的逻辑," 写一条评论,比导航 30 公里去一家店容易得多 "。刷一段评论如今不需要成本投入,但刷行为数据要难很多。所以用行为数据替代文本数据,成为了扫街榜全部故事的起点。毕竟在行为采集上作弊有门槛和难度,让数据本身变得值钱,是这套数采管线成立的前提。
一年时间之中,扫街榜围绕场景延伸出不同细分榜单,看上去更像是精确的数据标注要求。
发布 100 天,用户规模破 4 亿;一年之后,8.8 亿用户在榜单上发现新的吃喝玩乐,高德从中源源不断地获得来自真实世界的数据。
260 万商家主动入驻,高德免费为其制作飞行街景,有商家称上榜后用户规模增长 400%。郭宁在发布会上拿着成绩单,不点名地揶揄了一番其他榜单对标高德扫街榜修改评分规则,召开商家大会,清理虚假评论,按照真实评估数据作为排名依据。高德拿到了数据标准的话语权后,挺直了自己的腰板。
高德扫街榜是个免费的撬动数据的 " 杠杆 ",构建起了三层数据维度。
导航里程、专程前往比例、回头客、本地人占比所构成的行程数据构成了第一层数采维度。武汉的蟹神咩咩,顾客专程到店累计里程超过 47 万公里,专程比例 68%;北京的花家怡园,本地人占比 78%。类似的数据形式,大多带有因果关系,在此之前行业内是没有的。
经过清洗后的高质量数据,构成了高德第二层数据来源。具体方式是 838 万芝麻信用授权用户做了数采的前置准备,他们贡献的近 5000 万条评价,每一条都绑着真实身份。除了用户之外还有 KOL,为高德提供更为可信的数据来源。
如 @成都侦探四十九,三年走过 700 多家咖啡店,为 79 个品牌留下评价,从豆种、处理法讲到供应链。@江浙的神婆爱吃,一年写下 146 篇海鲜评价,细分出 13 种蟹。这些过程以评论形式,干了数据标注的活,真人体验带来了品味,高德不用为之付费,用荣誉称号就能撬动数据飞轮。
场景数据是高德 AI 化后,新增的数据来源,主要包括高德自称 "260 万商家 " 的飞行街景、营业状态、客流潮汐,皆由商家自己提供并维护。高德搭建起了一个有效的资源交换池,集团为高德投入 Token 预算用来生成,为商家提供更好的视觉展示;商家从上传的场景展示中获得流量。
尽管高德目前缺乏核销心智,但好歹有流量,大不了去大众点评核销。
对比一下成本可以看到高德的优势。购置一台数采设备约要数十万,投资一个数采中心要耗费上亿,才能实现日产千条的数据资产。高德的数采终端是 8.8 亿部手机,采集范围覆盖数百个城市门店。数据采集的成本结构基本上是负的,被采集方甚至心怀感激。
具身行业还在摸索数据采集的有效回路,而高德用榜单产品,便驱动用户与商家下场。
数采的尽头是模型
扫街榜建立起了真人采集系统,而这场发布会的四个产品,展示的是所采集数据能够驱动能力。
扫街榜所发布的新功能,从数据维度来看,其实是将采集数据的颗粒度继续变细。比如状元榜新增咖啡、酒吧、玩乐三个品类,烟火小店榜覆盖范围从 133 城扩到 269 城,榜单因时、因地、因人呈现,甚至还新增了扫街锦囊补充每家店的故事与到店须知。
高德内容生态中心负责人李刚在发布会上提到,算法从统计一家店有多少人去过,演进到同时理解人和场景。这实际上是由真人标注完成数据积累,然后将统计数字变为理解场景的要素。" 真探 " 像是产品化的数采手段,美食真探把实地探访变成内容供给,扩充榜单评估来源的上下文。
高德发布 ABot Earth 世界模型,拿着近亿的真人数采数据,郭宁对标谷歌的勇气就不再需要梁静茹给了。按照高德口径,自己做了全球首个全模态可预测 3D 原生城市世界模型,把空间、时间、现实信息组织成可进入、可探索、可推演的三维时空。
在大会上,高德提到了二维网络拓扑、三维空间结构,并引入了时序与真实世界的场景变化,这些要素共同构成了高德真实世界的模型。
前两层是过去 20 年,高德积累起的地图数据和 260 万商家的线下场景资产。后两层,基于拥堵预测(仿真数据)和 366 亿公里的流动数据。扫街榜持续为世界模型提供源源不断的数据供给,包括剧场选座、商场找店、千户苗寨看台阶,发布会上演示的三个场景全部来自真实采集。
结合一年前发布扫街榜,建立起数据回路,以及一年后发布会上鼓吹上下文能力,加上时空知识图谱和 15 类动态变量的实时协同仿真。扫街榜过去一年的动作,是希望从数据层面重构点评体系。
这次高德拿出了自己的实战结果。三份贵州五日游攻略,两份出自通用大模型,一份是全网点赞过万的保姆级攻略,放进高德的时空推演全部翻车。高德导航产品负责人孙冲解释说,高德能计算攻略对应当天的时序,以及物理世界按什么规律运转。
TOP 100 升级为年度榜 BEST 100,换个名词并不重要。高德眼下还有一个值得关注的动作是在扫街榜行之有效的基础上,进一步寻找更多、更新的物理世界接口。比如大会上提到与奔驰合作进入到车机,以及智能眼镜、手表、电动车、机器狗等合作生态。
终端为高德分发服务,同时也提供了另一个维度的数采触点,不论是什么厂商、何种形态的产品,数据最终会在榜单收敛后的应用端,汇集到高德。
导航 Live 则是触点的总成,按照孙冲的定义,导航从指引一段路,变成陪伴一整天,被重构为一个具备空间感知与行动能力的长程智能体。为此,高德甚至用了 " 余承东 skill",用全双工交互、全模态感知、全场景接力的 " 三全 " 来营销。
这其实是用免费方式获取持续、实时、第一人称的真实世界数据流。
数据的地租
具身智能尚未跳出数据的成本围栏。高德积累数据资产的方式截然不同,用户出设备、出时间、出劳力,KOL 与商家提供内容,有关部门出面站台,采集几乎不用拔高德的毛。
具身行业为真实数据难求付出真金白银,互联网公司用工具产品就能撬动起八亿数据。地图是真实世界中最重要的全民级入口,行为数据稍加约束就能防止刷量,两个条件叠加,低成本、高价值的数据便能源源不断地回传。
马老师垂帘式地窗口指导,或多或少可以看到些许深意。大模型已经吃尽了互联网语料,需要到物理世界中寻找下一个数据富矿。
语言模型理解语言,空间智能理解世界,郭宁在发布会上讲这句话时,很难不让人感觉是在划分阿里系两块数据资产的边界。阿里需要一张伸向真实世界的探针,采集空间、时间与人的流动数据,高德想做体系内唯一的物理世界探针。
这张探针用了一年时间给集团继续输血找到了必要性,因为获取同类数据,高德扫街榜的方式的成本更低、更无感。榜单、商家服务与车机合作本身就是生意,数采成本被摊销进了一门盈利的买卖里。
而此时高德手中握有很多选项,一张图能够承载起本地生活,如果进展不顺也可以做数据服务商。唯一需要观察的是,有了数据与能力后,如果给集团交付商业价值。
以到店为例,除了高德,阿里系目前至少还有两个团队正在扩充到店业态,淘宝闪购的逻辑是从到家至到店,支付宝的逻辑是为在线支付找一个落地场景。
回到具身智能公司打嘴仗的事情,邵天兰发朋友圈的那天,八亿人仍然在为高德数采,甚至没有人觉得自己被采集了。互联网的数采看起来或许能为具身智能提供些许参考,数采应该丝滑、无感,而且便宜。


登录后才可以发布评论哦
打开小程序可以发布评论哦