证券时报 5小时前
人手一个“世界第一”!具身大模型榜单超20个,含金量几何?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

" 拿下具身世界模型第一 "" 登顶具身智能榜单 "" 具身大模型登顶国际评测公开排行榜 " ……搜索最近的具身大模型新闻,满屏的 " 第一 " 和 " 登顶 " 跃入眼帘。在这个资本最密集的赛道,榜单已经变得不够用了。

当几乎所有头部公司都手握至少一个 " 第一 " 时,这些榜单究竟在衡量什么?记者调研发现,当前具身大模型榜单数量已超 20 个,但业内公认的权威标准尚未形成。仿真榜单刷分容易、真机测试成本高昂、榜单性质混杂—— " 第一 " 的含金量千差万别。在这场 " 榜单狂欢 " 背后,真正值得追问的是:如何让 " 榜单第一 " 经得起真实世界的检验?

人手一个 " 世界第一 "

8 月 11 日,越疆科技宣布,在面向复杂遮挡机器人抓取的国际评测赛事 UNOBench Challenge 公开排行榜上,越疆空弈 DobotWAM 具身大模型在两大赛道中同时登顶。越疆科技表示,这一成绩展现出该具身大模型从语义理解到动作前置推理的领先实力。

而就在此前不到半个月,具身智能公司智元宣布,其自研的具身原生全模态大模型 WITA-Omni Preview 在具身全模态理解权威榜单 DailyOmni 上,超过国内外众多领先模型登顶榜首。智元强调,DailyOmni 榜单高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力,登顶榜首意味着该模型在物理世界视听时序理解任务上具备独特竞争力。

如果将时间轴拉长,会发现在令人眼花缭乱的具身大模型榜单中,机器人公司都曾榜上有名,几乎人手一个 " 世界第一 "。

证券时报记者根据公开资料不完全梳理,今年 3 月,极佳视界宣布其自研的 GigaWorld-1 世界模型在权威评测基准 WorldArena 中登上全球榜首;4 月,中科第五纪宣布其研发的具身世界模型 FlowWAM 登顶 WorldArena 榜单;6 月,千寻智能宣布在全球具身智能实战评测平台 RoboArena 中,其自研模型 Spirit v1.6 排名全球第一。

纵观以上案例,涉及的榜单就有 4 个,每一个的形容词都是 " 全球 "" 权威 "。在层出不穷的 " 登顶榜单 " 新闻中,普通人很难分辨不同榜单之间有何区别、登顶到底意味着什么,只是在同质化的宣传话语中,留下 " 不明觉厉 " 的粗浅印象。

这与行业当前所处的阶段有关。安邦智库宏观经济研究中心助理研究员赵至江在接受证券时报记者采访时表示,具身智能正处于技术探索与产业验证的早期阶段。" 一方面,技术路线尚未完全收敛,还没有形成统一的行业评价标准。另一方面,资本市场对具身智能保持高度关注,企业需要通过测试成绩、演示视频和技术指标证明自身领先优势,客观上推动了部分指标包装和营销放大现象。" 赵至江说。

赵至江强调,不能简单否定榜单的意义,但也要客观看待其价值。" 不同企业仍在探索差异化的技术路径,在这种格局下,形成统一的行业评价标准并不容易。" 赵至江说,当前榜单更多反映企业在某一单项能力上的突破,而非技术水平的全貌。

榜单含金量各不相同

首先,要厘清的概念是,机器人公司竞相追逐的 " 榜单第一 " 究竟是什么,与通用大模型的榜单有何区别?

近一两年来,随着供应链的成熟,造一台机器人已经不是难事,行业竞争从 " 拼本体 " 转向 " 拼大脑 ",而这个 " 大脑 " 就是具身大模型。

因此,机器人要真正变得聪明好用,就需要拥有自己的具身大模型,重新采集训练机器人所需要的数据。通用大模型由于较为成熟,指标清晰,行业内已经形成了若干个公认的权威榜单,但具身大模型领域还没有。不同机构提出的榜单在评分维度与指标上差异较大,缺乏统一标准。

此外,天使投资人、资深人工智能专家郭涛告诉证券时报记者,具身大模型榜单高度依赖配套进行评测的机器人本体、执行器与仿真环境,分数无法脱离硬件单独成立。厂商可以通过调整机械参数、优化仿真环境定向提分,纯技术参考价值弱于通用大模型榜单。

其次,当前有哪些主流的具身大模型榜单,各自含金量如何?

据证券时报记者不完全梳理,当前各类具身大模型榜单数量已超 20 个,发起方包括清华大学、北京大学、普林斯顿大学、斯坦福大学等顶尖高校,美国艾伦 AI 研究院、上海 AI 实验室等研究机构,以及英伟达等企业。大多数榜单由几个机构联合发起。

按照不同类别,具身大模型榜单有不同的划分方式。如果从考察能力范围的全面性来看,可以分为综合能力榜单和专项能力榜单。前者就像对模型能力的 " 全面体检 ";后者则侧重专项测试,考察其特定能力或极端场景下的表现。如果按照评测环境与真实物理世界的距离来划分,则主要分为仿真任务榜单与真机测试榜单,前者如同理论考试,后者则像实战演习。

一名业内人士告诉记者,不同于通用大模型测评以数字形式输入、数字结果输出,可以线上进行,具身大模型真机评测需要匹配硬件和场地,耗时长,成本高,因此真机测试榜单十分稀缺。

" 仿真任务榜单是目前数量最多的,比如 LIBERO、RoboTwin、ManiSkill 等,它们标准化、低成本、容易复现,特别适合做算法横向比较。" 中国社会科学院大学数字中国研究院特聘研究员刘兴亮在接受证券时报记者采访时表示。在他看来,真机和真实场景评测是含金量最高的一类,目前一些榜单比赛已经开始采用 " 仿真初赛 + 真机决赛 " 形式,把仿真评测与实体机器人验证结合起来。

当榜单足够多、赛道足够细分,机器人公司总能找到某个维度让模型登顶。刘兴亮表示,一个榜单有没有含金量,应从四方面来判断:题目是否公开透明,测试集是否与训练集隔离,结果能否被第三方复现,能否经过真实世界的验证。" 科研评价关注的是能力问题,而产业评价关注的是技术能否形成稳定商业价值,两者本身就是不同逻辑。" 赵至江说,一些榜单是为营销、融资而服务,但真正有能力有价值的企业,最终会由具体的应用而不是榜单排名筛选出来。

亟需从 " 做题 " 走向 " 实战 "

具身大模型榜单看似热闹,但一个尴尬的现实是,仿真环境中的 " 学霸 " 到了真实世界,往往变成 " 学渣 "," 榜单上的高手,实践中的矮子 " 是行业的普遍现象。

原因是多方面的。首先,郭涛指出,许多榜单不具备完整有效的评价能力,测试场景单一,任务边界固定,无法覆盖工业、家庭等多元化的真实工况。一家公司在某个榜单上得分高,可能只是在该榜单的特定任务上表现优异,而非整体技术实力领先。

其次,大多数榜单基于仿真环境,与真机实测存在不可忽视的差距。" 在仿真环境里,光照可以标准化,摩擦系数可以设定,摄像机不会突然被人挡住。但进入工厂、商场和家庭以后,桌子可能挪了两厘米,袋子会变形,玻璃会反光,人可能突然伸手过来,网络还可能延迟。" 刘兴亮说,机器人面对的是一个开放、不确定并且持续变化的物理世界,仿真环境测试的结果更多是一种理想状态。

以被誉为具身智能领域 " 珠峰级 " 评测的 RoboDojo 为例,该榜单采取 " 仿真 + 真机 " 双榜单机制,设计了 42 个仿真任务和 18 个真实机器人任务,真实世界部分表现最好的模型总体成功率仅为 12.8%,折射出机器人落地的巨大鸿沟。

最后,部分企业存在定向 " 刷榜 " 行为,人为抬高分数。郭涛表示,有的是针对仿真榜单的 " 题库式刷分 ",比如企业提前获取测试任务样本,针对榜单内固定物体、固定动作场景专项微调模型权重,刻意降低陌生场景权重分配。有的是针对真机榜单的硬件调优,锁定专用测试样机,调试关节阻尼、运动速度适配榜单任务,规避通用工况的严苛约束。此外,个别厂商还可能针对一些榜单挑战赛的规则,利用自己注册的评测账号不断测试、刷新评分。

刘兴亮指出,破解榜单 " 虚假繁荣 ",关键不是取消榜单,而是把考试从 " 做题 " 变成 " 实战 "。在他看来,具身大模型榜单需从以下几个方面加以改进:一是评测标准要统一。现有的评测在环境设置、硬件配置、测试条件等方面都不同,不同模型间很难进行公平对比,唯有制定更统一的标准,才能提高结果的可复现性。二是需要引入盲测,测试任务不能全部提前公开,最终排名应由隐藏测试集、陌生物体、陌生场景决定,以此达到防 " 刷榜 ",真正测试机器人泛化能力的目的。三是将仿真测试与真机测试结合起来,验证机器人在物理世界的可靠性。

" 目前,具身智能还处于发展的早期阶段,评价更多围绕单项能力、实验性能、技术参数展开,目的在于证明技术路线是否成立。随着产业进入应用阶段,评价体系会逐渐转向综合能力,由技术展示驱动转向产业价值驱动。" 赵至江说,一个成熟的产业,通常不会依赖技术性的榜单作为评价标准,而是形成由行业标准、第三方测试和市场反馈共同构成的评价体系。" 具身智能距离这一阶段还有较长过程,三到五年甚至更长的时间都是有可能的。" 赵至江表示。

(本文原载于《证券时报》8 月 18 日 A2 版)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 物理 越疆科技 宏观经济 安邦
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论