近日,由北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的TriWorldBench Challenge,正式公布首周榜单更新结果。
作为首个面向机器人三视角世界模型的评测榜单,TriWorldBench 旨在建立更加全面的具身世界模型评价体系,推动世界模型从 " 视觉生成 " 迈向 " 世界理解 "。
榜单综合评估模型在三视角一致性、任务执行、物理空间理解等方面表现,面向全球相关研究团队开放参与,目前已收录多个公开评测结果,后续将持续更新评测结果。
(榜单地址:https://www.triworldbench.com/#leaderboard)

第一周的比赛中,来自 CASIA-DRL 的 WoVR_Plus 模型、来自 TONGJI Spatial Intelligence Team 的 BetaBWM 模型、以及来自 Fysics AI 的 Fysiverse-Video 模型占据了榜单的前三席。
从 " 生成视频 " 到 " 理解世界 ",具身世界模型的新评价标准得到参赛者认可
TriWorldBench 自发布以来,网页总访问量已破万,测评工具下载量超 200,网页日访问量逾千;短短一周时间已经有 14 个正式参赛队伍。
这表明,三视角世界模型的竞争焦点已从单一视图的视觉保真度,转向多视角(head view、left-wrist view、right-wrist view)间的时空一致性与物理逻辑自洽性。
当前排名差异主要源于模型在多视角几何对齐、任务执行准确性及物理动态理解等维度的表现,而非单帧图像的感知质量。
TriWorldBench 旨在建立一套系统化评估框架,对上述多维能力差距进行精确量化与可解释性分析,从而推动世界模型从 " 视觉生成 " 向 " 具身认知 " 范式演进。
如何判断一个世界模型,是否真正理解了机器人所处的世界?

该榜单聚焦机器人操作场景中的head view(头部视角)、left-wrist view(左腕视角)、right-wrist view(右腕视角)多视角视频生成与理解能力,希望建立更加全面的世界模型评价标准,推动具身世界模型从 " 视觉生成 " 迈向 " 世界理解 "。
从 " 生成视频 " 到 " 理解世界 ":具身世界模型新的评价标准
过去,视频生成模型的评价更多关注:
画面是否清晰;
内容是否符合描述;
视频是否连续流畅。
但对于具身世界模型而言,仅仅生成一段 " 看起来真实 " 的视频远远不够。
机器人需要面对的是一个动态、连续、具有物理规律的世界。
在真实机器人系统中,一个任务通常由多个摄像头共同观察:
头部摄像头负责提供整体环境信息,帮助机器人理解任务状态;
腕部摄像头贴近操作区域,可以捕捉抓取、接触等细节。
不同视角之间并不是简单的信息重复,而是共同构成机器人对世界的完整认知。
因此,一个真正可靠的具身世界模型,不仅需要生成单个视角下合理的视频,还需要保证:
多个摄像头看到的是同一个世界。
这也成为当前世界模型评测体系中亟待解决的新问题。
TriWorldBench:面向具身世界模型的三视角评测体系
针对多视角一致性这一核心挑战,TriWorldBench Challenge 提出了一套面向机器人操作场景的综合评测体系。
相比传统单视角视频评价方式,TriWorldBench 更加关注模型是否具备真实世界理解能力。

多视角一致性:三个摄像头是否描述同一个世界?
TriWorldBench 首先关注三路视角之间能否相互对应。
模型生成的头部、左腕和右腕视频,不仅要各自合理,还需要保证:
活动机械臂和动作阶段相互对应;
抓取、接触及动作进度保持一致;
目标物体的类别、外观和状态不存在冲突。
换句话说,三路视频不能只是分别 " 看起来合理 ",还需要共同描述一次完整、连贯的机器人操作过程。
任务执行能力:机器人是否真的完成了任务?
对于机器人而言,视频生成不是最终目标,完成任务才是核心。
TriWorldBench 进一步评估模型对于机器人操作过程的理解能力,包括:
指令是否正确执行;
机械臂运动是否符合预期;
抓取、移动、释放等操作是否合理。
其中,头部视角主要用于判断任务指令、机械臂轨迹和最终结果;腕部视角则进一步检查抓取是否稳定、是否发生滑移,以及夹爪与物体之间的局部交互是否正常。
这意味着,画面看起来足够清晰、流畅,并不代表机器人真正完成了任务。
TriWorldBench 希望让世界模型评价从 " 看起来像 " 进一步走向 " 真正可用 "。
物理世界理解:模型是否真正理解三维空间?
机器人面对的是三维物理世界。
因此,世界模型不仅需要生成视觉内容,还需要理解:
物体之间的位置关系;
动作变化过程;
不同视角下的空间对应关系。
TriWorldBench 希望通过多视角评测,进一步探索世界模型对于真实环境的理解能力。
不只是排名:TriWorldBench 更希望成为帮助研究团队优化模型的诊断工具
对一个榜单来说,排出名次只是第一步。
更重要的是,它能否解释模型为什么得分高或低,并把清晰的改进方向反馈给研究者。
TriWorldBench 因此没有把三路视频压成一个简单平均分,而是建立了从同步数据、动作状态到多层结果的完整评测链路。
从数据到指标:TriWorldBench 如何全面评估模型能力
基准包含 500 个三视角同步 episode,覆盖 50 个机器人操作任务。
系统围绕三视角一致性、任务对齐、物理与 3D 一致性、运动质量、时序一致性和视觉质量六个维度,汇总 19 项评测信号,并以 TWB-Score 作为榜单总分。
三个视角如何共同判断机器人任务状态
三视角一致性被放在整个体系的中央。
每个生成视角先与对应的真值相机进行对照,再通过 head-wrist 语义判断和联合三视角问答,检查机械臂状态、动作阶段、接触关系以及目标物体是否相互兼容。评测并不要求视角差异巨大的头部画面与腕部画面在像素上相同,而是判断它们能否共同解释同一次操作。
与此同时,指标会被分配到证据最可靠的相机。头部视角更适合判断任务指令、全局进度、机械臂轨迹和最终结果;
腕部视角更适合观察接触、抓取稳定性、滑移和局部几何。
这样既不会让腕部遮挡影响全局任务判断,也不会让清晰的头部画面掩盖夹爪附近的失败。
STATE 让评测知道何时该动、何时该稳
TriWorldBench 从参考机器人轨迹中构建 STATE 标注,识别当前动作阶段、活动机械臂,以及每个视角预期处于运动还是静止。
该动的腕部如果长时间冻结会被扣分,不该动的相机出现多余运动同样会被识别。
由此,稳定不再等同于 " 全程不动 ",运动丰富也不再天然代表模型理解了任务。
总分用于排名,细粒度结果用于诊断
画质和美学分数也不会脱离任务单独决定胜负。
当头部轨迹错误,或三路视频在机器人和物体状态上发生冲突时,系统会对视觉质量进行任务约束后的修正,避免一段精致但错误的视频凭借 " 好看 " 获得不合理优势。
在 VLM 语义评测中,评测协议还会先与人类专家的打分和排序进行对齐,再冻结规则用于正式测试。
榜单除了报告 TWB-Score,还保留六大维度、单项指标、逐视角、head-wrist 配对和联合三视角结果。
研究团队因此不仅能看到排名,还能判断问题究竟出在任务、运动、画质,还是三个摄像头之间的世界状态没有对上。
这让 TriWorldBench 更像一套面向研发的 " 体检报告 ":它不只回答谁更强,也帮助解释模型下一步应该改进哪里。
面向全球团队开放报名,共同探索具身世界模型下一阶段
TriWorldBench Challenge 面向全球相关研究团队开放报名。
参与对象包括但不限于:
具身世界模型研究团队;
具身智能团队;
视频生成模型团队;
多视角生成与理解方向团队。
无论是专注视频生成能力,还是探索机器人交互与空间智能方向的模型,都可以通过统一的数据和评测体系参与挑战。
通过公开榜单,TriWorldBench 希望为不同技术路线提供公平比较的平台,同时推动具身世界模型领域形成更加统一、科学的评价标准。
未来的机器人,不仅需要看到世界,更需要理解世界、预测世界,并在真实环境中完成复杂任务。
TriWorldBench Challenge 希望推动行业共同回答一个关键问题:
一个真正具备智能的世界模型,应该如何被评价?
首周榜单结果只是一个开始。随着更多前沿模型加入这场挑战,TriWorldBench 正在成为观察具身世界模型技术进化的重要平台。
未来,谁能让机器人更准确地理解空间、预测变化并完成复杂任务,将在持续更新的榜单中逐渐揭晓。
TriWorldBench Challenge 已开放官方网站及 GitHub 开源仓库,欢迎全球研究者参与交流:
TriWorldBench 官网网站:https://www.triworldbench.com/
GitHub 开源:https://www.github.com/TriWorldBench/TriWorldBench
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦