去哪训练、拿什么学、怎么考?这是物理 AI 从实验室走向现实世界的三个核心问题,现在有了系统性答案。
作者丨张 璐
编辑丨幸丽娟
物理人工智能(Physical AI)与具身智能正在经历一场深刻的范式转移。
从早期局限于单一任务的特定控制算法,到如今依托多模态大模型实现对三维物理世界的感知、推理与决策,AI Agent 正在逐步突破数字世界的边界。
然而,当智能试图走出虚拟空间、迈入现实世界时,底层基础设施的匮乏成为了最大掣肘。
要支撑物理 AI 的持续进化,行业必须回答三个核心问题:去哪里高效训练?高质量数据从何而来?如何科学评估空间智能?
群核科技集结了英伟达、英特尔、Adobe 等产业巨头,携手浙江大学、帝国理工学院、苏黎世联邦理工学院等全球顶尖学术机构,共同交出了一份系统性答卷。
三个问题,分别对应三篇入选 ECCV 2026 的论文。下面,我们分别看这三篇论文,给出了怎样的参考答案。
01
SPEAR:打破仿真
" 画质 - 速度 - 可编程 " 不可能三角
智能体要进行大规模感知与动作训练,离不开高保真仿真器的支撑。然而,传统仿真器往往面临 " 画质 " 与 " 速度 " 无法兼得的尴尬局面。
针对这一行业瓶颈,群核科技携手NVIDIA、Adobe Research等顶级团队,推出了高保真具身仿真器 SPEAR,尝试从底层同时兼顾 " 高保真 "、" 可编程 " 与 " 极速运行 "。
论文链接:https://arxiv.org/pdf/2607.06701
作为一个轻量且模块化的 Python 库,SPEAR 重新设计了 Python 与游戏引擎之间的通信机制。
SPEAR 直接对接了 Unreal Engine ( UE ) 的C++ 运行时反射系统。它不需要人为编写海量的封装代码,而是在运行时以字符串为键,动态查找类、调用函数并修改变量。
这种设计让 SPEAR 一举向 Python 开放了14485 个 UE 原生函数与53537 个属性,可编程能力比传统仿真器提升了一个数量级,而自身代码量却精简至约 2.7 万行。开发者甚至只需在 C++ 中加一行标记,就能立刻在 Python 端调用全新的自定义逻辑。
各种 UE 仿真器可编程功能的比较
针对数据传输这一最大痛点,SPEAR 引入了进程间共享内存机制。渲染出的图像无需经过任何多余的复制流程,即可直接从 GPU 传输至 Python 端的 NumPy 数组中,实现了真正的 Zero-Copy 传输。
同时,SPEAR 提出了以 " 事务 " 为核心的异步编程模型。
研究人员通过 和 < end_frame> 上下文定义每一帧的 UE 工作图。凭借异步调用机制,SPEAR 在独立的服务器线程中排队处理任务,完全不阻塞 UE 的游戏主线程,让仿真程序得以按原生帧率高效运转。
SPEAR 编程模型
在性能表现上,SPEAR 搭载的相机传感器能在 1080P 分辨率下达到73 FPS(渲染吞吐超 1.5 亿像素 / 秒),端到端渲染速度比 UnrealCV+ 快 15 倍,比 AirSim 快 12 倍。除了常规视觉图像,它还能直接导出深度图、法线图、语义分割、材质 ID 以及基于物理的渲染(PBR)参数等丰富模态。
强大的图形学底座与极高的灵活性,让 SPEAR 在多个复杂场景中展现出惊人的应用潜力:
全地形多 Agent 精准控制:SPEAR 能够同时操控行人、汽车、飞行机器人、四足机器人等 6 种具备不同动作空间的具身智能体。
动态程序化场景(PCG)调控:直接介入 UE 的程序化生成系统,实时操纵大型地形要素(如岩石、植被)以及天空光影的时段变化。
与物理引擎协同仿真:支持与 MuJoCo 物理引擎实时 Co-Simulation,在 MuJoCo 计算动力学的同时,由 SPEAR 同步渲染出高保真三维视觉。
自然语言驱动的场景编辑:借助完整的 Python 接口,大模型编码助手可以根据自然语言指令(如 " 把沙发上面的灯光调亮、地面变光亮 "),自动编写 SPEAR 代码完成场景的实时重构。
SPEAR 提供了可编程、高吞吐的 UE 仿真接口,适合作为具身智能的训练与数据生成环境之一。
02
Syn-GRPO:告别死记硬背,
让大模型 " 自己造试卷 "
解决了 " 去哪里训练 " 的环境难题后,物理 AI 的下一个核心痛点,在于后训练阶段的强化学习效率。
虽然强化学习(如基于 GRPO 的策略优化)已在多模态大模型的视觉感知与推理任务中展现出巨大潜力,但当前的训练机制正面临严重的 " 数据质量陷阱 "。群核科技与浙江大学合作的发表的 Syn-GRPO 框架,尝试通过在线自进化合成数据来给出解法。
论文链接:https://arxiv.org/pdf/2511.19343
在 GRPO 等强化学习算法训练过程中,研究人员发现 MLLM 的输出熵和多样性呈现出急剧下降的趋势,这一现象被称为" 熵崩溃(Entropy Collapse)"和" 多样性崩溃 "。
造成崩溃的本质原因,在于现有的视觉感知数据集(如传统的目标检测、视觉定位数据)样本格式与背景过于单一。模型在训练初期很快就能学会 " 套路 ",输出分布迅速收缩,导致算法探索空间极度受限。
先前针对大模型 RL 的改进尝试(如 CLIP-Higher、Clip-Cov、Entropy Adv.)大多试图从 GRPO 算法本身通过正则化或熵惩罚来缓解问题,但这些方法治标不治本,始终无法突破低质量数据带来的固有上限。
为了从根本上打破数据质量天花板,团队抛弃了静态数据集的传统思维,转而在强化学习训练的循环中,让模型在线 " 自进化 " 地生成高质量、高响应多样性的训练样本。
Syn-GRPO 框架
不同于纯文本大模型可以通过提示词直接合成新文本,视觉感知任务(如 Bounding Box 定位)对图像内容与物理标注的精准性有着苛刻的要求。如果直接用生成模型重绘整张图像,原有目标的坐标就会失效。
为解决这一难题,Syn-GRPO 的数据服务器巧妙地设计了前景一致性生成机制。
系统首先利用 BEN2 分割模型精准抠出视觉感知任务的目标主体(如车辆、小动物),随后保留原目标的物理坐标,仅将背景替换并通过基于 SDXL ControlNet 的重绘模型合成全新的复杂场景。这种做法不仅百分之百保证了原感知标注的准确性,还极大地扩充了环境背景的多样性。
更关键的是,数据服务器与 GRPO 训练流采用了完全解耦的异步通信架构。数据合成分布式地在后台静默执行,使得 Syn-GRPO 的训练耗时仅比原始 GRPO 增加约 5%,完美避免了同步合成方案导致的耗时翻倍问题。
为了确保新生成的图像能精准击中模型的 " 认知盲区 ",GRPO 工作流对 MLLM 的输出结构进行了重构。
模型在输出推理逻辑与答案的同时,还被要求预测当前样本的响应多样性得分以及用于制造新图像的文本描述。
通过将模型预测的多样性与当前 Batch 实际采样产生的真实方差进行对比,算法计算出专属的多样性奖励,借此引导 MLLM 学会识别并描述那些能够激发更高探索活力的复杂场景。
针对强化学习后期模型整体多样性下滑引起的 " 多样性漂移 " 现象,Syn-GRPO 引入了指数移动平均(EMA)校准机制进行动态平滑,显著提升了策略优化的稳定性。每轮采样中多样性奖励最高的那组描述,将被自动推送到数据服务器,作为制造下一代训练样本的 " 配方 "。
在 REC(指称表达理解)、OVD(开放词汇目标检测)以及 ISR(室内场景精细化)三大视觉感知任务的实测中,Syn-GRPO 展现出了压倒性的优势。以 Qwen2.5-VL-3B 为基座,Syn-GRPO 在 Out-of-Domain 评价集 LISA-Grounding 上取得了68.28%的准确率,大幅领先 VLM-R1(63.14%)和标准 GRPO(62.24%);在 RefCOCO 数据集上更是达到了92.15%。
Qwen2.5-VL-3B 在 REC 任务上的实验结果
OVD 任务上的实验结果
比单纯的指标提升更具启发性的,是实验中观察到的 " 自进化 Scaling 现象 "。随着训练 Epoch 的不断推进,Syn-GRPO 驱动生成的图像呈现出背景越来越杂乱、遮挡关系越来越复杂的趋势。
这表明 Syn-GRPO 真正构建了一个动态演化的训练系统:随着大模型感知能力的增强,系统能够自动为自己生成难度更高、更具挑战性的 " 新试卷 ",从而源源不断地为强化学习注入探索活力,展现出长程训练的优秀可扩展性。
03
WalkerBench:走出实验室,
去真实世界里考 AI 的空间感
在搭建了高保真的仿真演练场并实现了数据的在线自进化之后,最后一个问题浮出水面:如何科学衡量智能体在三维物理世界中的真实空间智能?
当前主流的视觉语言模型评测基准普遍采用 " 旁观者视角 ",即向模型提供一张静态图片或一段预录视频,让其回答几何关系或物体位置。然而,真正的空间智能并非静态的观照,而是在主动移动与交互中通过消除几何歧义、建立拓扑认知来解决复杂任务。
针对这一痛点,群核科技联合浙江大学等团队推出了WalkerBench,尝试重新定义物理 AI 的空间感知评测标准。
GitHub 链接:https://github.com/lalayang123456-ctrl/WalkerBench
作为首个建立在真实街景与地图数据之上的全球尺度交互式空间智能评测基准,WalkerBench 彻底剥离了 GPS 信号与街名等先验地图信息,要求 Agent 仅凭机载第一视角 RGB 视觉输入完成自主探索。
WalkerBench 覆盖了全球 6 大洲 160 多座城市,并在采样中特意选用了大量非英语城市(如达卡、罗安达、卡拉奇等),以此抑制大模型的地理常识记忆偏见,确保评测精准聚焦于实时的视觉空间推理能力。其任务体系被划分为两大层次:
主动感知:智能体必须通过主动移动消除几何视角歧义,精准估计三维空间中的距离、建筑高度以及相对方位等度量指标。
空间导航:智能体需在涵盖网格状、环形、放射状等 8 种城市拓扑结构(如 Grid、Block、Star、Curved 等)的环境中完成长程导航。导航被细分为剥离街名的结构导航与基于地标语义描述的多模态导航。
WalkerBench 概览
在 WalkerBench 的长程测试中,研究人员发现主流 VLM 在面对 3D 拓扑任务时存在致命缺陷:模型的线性上下文机制难以处理高维度的空间轨迹,随着探索步数增加,很容易陷入 " 走着走着就忘了 " 的记忆崩塌与方向迷失。
为此,WalkerBench 提出了专门的Spatial-IDE破局框架。该框架通过两大机制彻底解耦了空间感知与高层推理:
1. 状态外化与显式拓扑记忆(ETM):将隐式的视觉观测转化为一个动态的显式拓扑记忆图(ETM)。该图实时记录节点的坐标、朝向、遍历历史以及语义注释,并以固定 Token 预算进行序列化传输,为大模型提供了精准的 " 空间地图外挂 "。
2. 认知解耦与目标导向感知(GDP):将任务拆解为高层空间推理引擎与目标导向感知(GDP)。推理引擎只关注全局路径规划与决策,而感知模块则专职回答具体的局部问题(如 " 前方招牌是否可见,相对角度是多少 "),防止过长的上下文历史压垮大模型的推理能力。
Spatial-IDE 框架
WalkerBench 在学术界与产业界引发了强烈反响,其公布的一系列实验数据深刻揭示了当前多模态大模型的真实短板。
在零样本交互导航评测中,人类受试者的任务完成率达到了 69.43%,而未配备辅助框架的顶尖 VLM Agent(如 Claude-Opus-4.6)最高却仅有 24.49%。这一巨大差距表明,单纯依靠 2D 静态图像预训练的大模型在三维空间交互智能上远未饱和。
在引入 Spatial-IDE 框架后,被测的 9 个主流 VLM Agents 均取得了巨大的性能突破,平均得分提升了104.97%。例如,Claude-Opus-4.6 的完成率跃升至43.17%(绝对提升 18.68%);GLM-4.6V 从 13.31% 飙升至31.77%;而原始得分垫底的 GPT-5-chat-latest 在状态外化帮助下性能暴涨119.98%。
消融实验进一步证实,ETM 记忆图与 GDP 目标感知的结合产生了极强的协同效应,证明了 " 记住什么 " 和 " 看什么 " 在空间推理中的核心价值。
为了进一步验证算法在真实物理世界中的落地能力,除了虚拟仿真评测之外,研究团队还通过真机部署检验了系统的泛化表现。
实验将 Spatial-IDE 框架直接部署于宇树 G1 人形机器人。在未经任何特定物理环境微调的前提下,机器人仅依靠机载单目 RGB 摄像头和自然语言指令,在真实的开放城市街道中完成了连续多街区的千米级自主导航。这一实测结果表明,该系统具备从数字仿真向复杂真实世界直接迁移(Sim-to-Real)的可行性。
04
从虚拟仿真到真机部署:
物理 AI 需要什么样的技术底座?
拆解这三项入选 ECCV 2026 的工作,每一项都切中了具身智能当前的关键瓶颈:SPEAR 尝试平衡仿真器的渲染画质与吞吐效率,Syn-GRPO 致力于解决多模态强化学习中的数据崩溃问题,而 WalkerBench 则为空间智能提供了一套可交互的物理评测标准。
但这三项研究更值得关注的价值,在于它们并非零散的单点试验,而是构成了一套相互咬合的具身数据循环机制:
SPEAR(仿真环境):通过高吞吐与高保真的虚拟空间,为智能体提供了高效率、低成本的演练平台,解决底层数据的源头供给;
Syn-GRPO(算法进化):在训练循环中引入前景一致性生成,让数据随着模型的训练动态变难,使得强化学习摆脱了对静态数据集的依赖;
WalkerBench(空间评测):在复杂物理场景下检验智能体的空间推理与导航能力,其暴露出的能力边界(如长程记忆缺失、视角歧义等),又能反向指导仿真环境的构建与强化学习样本的生成。
从 " 虚拟仿真 " 到 " 在线自进化 " 再到 " 真机实测 ",数据、算法与评测三者形成了一个动态演进的闭环。
这同时印证了一个趋势:物理 AI 的竞争,正逐渐从单一的模型参数比拼,转向基础设施层的建设。
正如大语言模型的发展依赖于海量文本的沉淀,具身智能要跨越虚拟与现实的界限,同样需要能够支撑大规模训练与持续进化的底层基础设施。
群核科技结合自身在 3D 数字孪生与图形学渲染领域的积累,通过与全球学术及产业团队合作推出的这三项成果,尝试为物理 AI 搭建一套涵盖 " 仿真 - 训练 - 评测 " 的技术底座。
随着多模态模型与物理环境的持续融合,这种基础设施维度的技术积累,或将为具身智能从代码走向物理世界的落地过程提供切实的参考。
为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信 Qvv0909777,备注:ECCV + 单位 / 学校 + 姓名 + 方向。
搞科研 / 搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。


登录后才可以发布评论哦
打开小程序可以发布评论哦