雷锋网 18小时前
ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。

   

     作者丨岑峰   幸丽娟

    编辑丨岑峰

                                                                                                       

在通往 AGI 的浪潮中,基础模型智能体(Foundation Model Agents)正以前所未有的速度接管各种任务。业界曾普遍乐观地认为,凭借大模型海量的预训练知识,智能体可以无缝适应各种真实场景。

但在现实中,当我们将一个在英文语境下表现完美的智能体,切换到中文或低资源语言环境中时,其错误率往往会呈现断崖式上升。

这种环境切换带来的 " 智力降级 ",真的是大模型时代特有的新问题吗?

在正在进行的 2026 年的德国不莱梅 IJCAI 大会的 Early Career Spotlight(早期职业焦点)环节,亚利桑那州立大学(ASU)助理教授魏华给出了一个极具启发性的 " 降维 " 视角:今天大模型智能体所面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的 " 仿真到现实(Sim-to-Real)" 差距如出一辙。

作为长期深耕强化学习与真实世界决策的学者,魏华教授早年曾在腾讯 AI Lab 担任研究员,后于新泽西理工学院和 ASU 任教。早在 2017 年,魏华团队就通过一系列 KDD 论文证明了强化学习能够完美复现传统的 " 绿波 " 优化解,甚至能找到更优的调度策略。

但随着研究从实验室走向中国杭州等真实复杂路网,他发现,完美的模拟器是不存在的。天气、摄像头视角、甚至奖励函数的定义,在真实世界中都存在着致命的偏差。实验室中取得的完美结果一旦部署到真实的街头,面对大雨、大雾以及穿行的行人,AI 的决策就会瞬间崩溃。

在此次 IJCAI 的演讲中,魏华巧妙地将 " 交通信号灯 " 与 " 大语言模型 " 连接了起来。他指出,无论是机器人、强化学习还是今天的大模型智能体,只要涉及决策与执行,就必然面临动态差距、观察差距和奖励差距。

更为重要的是,他提出,既然问题的本质相同,我们完全可以将机器人领域成熟的 " 域随机化(Domain Randomization)" 等技术,直接 " 平移 " 到大模型智能体中。最新的实验证明,通过对智能体的提示词、动作和奖励空间进行随机化扰动,一个仅 30 亿参数(3B)的模型,在应对跨语言等 " 仿真到现实 " 难题时,其表现甚至能击败 320 亿参数(32B)的庞然大物。

此外,魏华强调了 " 不确定性量化 " 与 " 人类在环(Human-in-the-loop)" 的终极价值:智能体可以无限扩展,但不能增加人类的监督负担。机器必须知道自己 " 何时不知道 ",并精准地向人类求助。

以下是魏华教授的演讲分享,演讲题目为《Towards Reliable Agents》。AI 科技评论根据其英文演讲内容进行了不改原意的深度编辑与精简:

▎ Towards Reliable Agents(迈向可靠智能体)

演讲者: 亚利桑那州立大学助理教授 魏华(Hua Wei)

大家好。我是亚利桑那州立大学计算与人工智能学院的助理教授魏华。非常荣幸能来到 IJCAI 的讲台,分享我过去研究的一些反思,探讨我们曾尝试的不同视角,以及对未来工作的展望。

我们团队一直以来的一个核心命题是:我们能否为现实世界的复杂决策,构建真正可靠的智能体(Agents)?

01

完美的模拟器,与混乱的物理世界

为了说明这个问题,我们回到 2017 年,从我最初研究的 " 交通信号控制强化学习 " 说起。我们希望通过协调城市里的每一个交通信号灯,让所有车辆都能更顺畅地通行,并将其部署到物理世界中。

这一时期,我们做了一些关于多智能体系统和 " 仿真到现实(sim-to-real)" 迁移的研究。以交通信号控制为例,在交通信号控制的强化学习中,智能体的 " 状态 " 是路口的排队车辆数," 动作 " 是切换红绿灯," 奖励 " 则是最小化所有车辆的通行时间。

在 2018 年和 2019 年的 KDD 论文中 [ 1,2 ] ,我们证明了强化学习确实能学到与传统运筹优化相同的最优解,比如著名的 " 绿波 " 效应(让车辆一路绿灯畅行),而且它能更好地适应非匀速的真实车流。

然而,当我们试图把在模拟器里训练得炉火纯青的算法拿去现实中部署时(例如在中国杭州的真实复杂路网),问题出现了。在模拟器中,汽车的驾驶行为高度规律,但在现实世界,每个交通参与者都有自己的目的,路况瞬息万变,根本不存在一个能完美拟合真实物理世界的模拟器。

这就是我们所说的 " 仿真到现实(Sim-to-Real)" 差距。基于这种惨痛的现实认知,我们开始深入研究 Sim-to-Real 的迁移问题。我们的目标是让模型在模拟环境中的表现与在真实世界中的表现无限趋近,让差距(Gap)接近于零。

在研究中 [ 3 ] ,我们将这种复杂的现实鸿沟系统性地拆解为了五个子维度:观察差距(Observation Gaps)、状态差距(State Gaps)、动作差距(Action Gaps)、动态差距(Dynamics Gaps)以及奖励差距(Reward Gaps)。

例如动态差距,在模拟器中,如果变绿灯,我们假设所有车都会顺利通过。但如果在真实的雨天、雾天或雪天,车辆行驶缓慢,同样的绿灯时长,可能只有两辆车通过,剩下一辆被堵在路口。这意味着:相同的状态和动作,在虚实两个世界中会导致完全不同的下一个状态。

随着时间的推移,这种偏差(Drift)会像滚雪球一样越来越大。在 AAAI 2024 的工作 [ 4 ] 中,我们尝试将天气等背景信息作为条件输入来缩小这种差距,但仍无法做到完美。

还有观察差距,在训练中,摄像头视野清晰;但在雾天、雪天或黑夜,传感器捕捉到的画面会大打折扣 [ 5 ] 。模型如何能保证在完美视觉下训练的策略,在恶劣天气或夜间依然鲁棒?

以及奖励差距,在模拟器里,我们的唯一目标是最小化汽车的通行时间。但在真实世界中,你不能只看汽车,还要考虑行人的安全和通行效率。一旦引入真实约束,你原本设定的完美奖励函数就会发生剧变,目标函数的错位,会导致智能体做出危险决策。

02

大模型智能体,正在重蹈覆辙

刚才我们谈论的是传统强化学习,但我们惊讶地发现:如今备受追捧的基础模型智能体,正在面临完全相同的挑战,只是人们换了一套术语。

以大模型的多语言能力为例,如果用英语向大模型提问,它表现得完美无瑕;但如果切换到中文、德语甚至一些低资源语言,它的错误率就会出现断崖式上升。在自然语言处理(NLP)领域,大家管这叫多语言泛化难题。

但在上周的 KDD 大会上 [ 6 ] ,我们提出:基础模型智能体中的可靠性问题,本质上就是一个标准的 " 仿真到现实 " 问题

如果把每种语言看作一种 " 模态 ",模型的训练数据主要是一种模态(英语语境,相当于 " 模拟器 "),而它的测试环境是另一种模态(其他语言,相当于 " 复杂的真实世界 ")。这就完美对应了我们刚才提到的 " 观察差距 "。

既然问题的本质相通,我们完全可以从成熟的强化学习或机器人领域 " 借用 " 破局思路。

03

用 " 域随机化 " 为大模型降维解局

在机器人控制中,为了弥补模拟器与现实的差距,我们常用一种叫 " 域随机化(Domain Randomization)" 的技术:在训练时人为地对输入的文本、标题、描述甚至动作和奖励空间进行随机化扰动。以提升模型在真实世界中的鲁棒性。

我们将这一理念直接引入到了大语言模型智能体中,在测试大模型时,我们对其输入的文本、提示词、参数描述甚至它所面临的动作与奖励空间,进行大规模的 " 随机化重写与扰动 " [ 7,8 ] 。结果令人极其振奋:一个仅仅 30 亿(3B)参数的小模型,在经过域随机化处理后,其应对跨环境差距的表现几乎接近完美,甚至击败了规模大十倍的 320 亿(32B)参数的最佳模型。

这说明,机器人领域历经检验的 " 抗干扰 " 哲学,在今天的大模型智能体时代依然是大杀器。动作、奖励、转换等维度的差距,是所有决策智能体共通的顽疾。

04

随机化与 " 不确定性量化 " 的安全底线

最后,我想谈谈我个人目前极其兴奋的研究方向:不确定性量化(Uncertainty Quantification)。在试图弥合虚实鸿沟的所有方案中,我们必须承认一个现实:我们可能永远无法做到完美的闭环。

面对充满未知的真实世界,如果我们想要保证智能体在真实世界中不出致命错误,最终极的防线始终是 " 人类在环(Human-in-the-loop)"。机器必须知道自己 " 什么时候不确定 ",知道何时该自主决断,何时必须呼叫人类支援,在关键时刻将决策权交给人类。

▎为此,我们为大模型定义了四个层级的不确定性量化 [ 9 ] :

1. 答案本身是否值得信任?

2. 模型的推理逻辑是否脆弱?

3. 能否精确定位是哪一步推理犯了错?

4. 该智能体的认知是否与其他模型 / 系统对齐?

总结而言,我们认为 " 仿真到现实 " 的差距广泛存在于机器人学、强化学习、真实世界以及基础模型智能体等大多数决策场景中。我们呼吁上述领域的学者建立一套共通的底层词汇与评估标准,我们就可以测试并且共享相同的技术。

在未来,智能体可以无限制地扩大规模、接管更多的任务,但人类的监督负担绝不能随之呈指数级加重。让机器学会在不确定时求助,把最关键的问题留给人类,才是 AI 走向真实世界的最优解。

以上是我的演讲。如果你们对这一话题感兴趣,欢迎在微信、LinkedIn 以及我的播客上 [ 10 ] 进一步交流。

[ 1 ] Hua Wei, Guanjie Zheng, Huaxiu Yao and Zhenhui Li. IntelliLight: A ReinforcementLearning Approach for Intelligent Traffic Light Control. In Proceedings of the 24th ACMSIGKDD International Conference on Knowledge Discovery and Data Mining ( KDD2018 ) .

[ 2 ] Hua Wei, Chacha Chen, Guanjie Zheng, Kan Wu, Vikash V. Gayah, Kai Xu andZhenhui Li. PressLight: Learning Max Pressure Control to Coordinate Traffic Signals inArterial Network. In Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining ( KDD 2019 ) .

[ 3 ] Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam, AlvaroVelasquez, Paulo Shakarian, Hua Wei. A Survey of Sim-to-Real Methods in RL:Progress,ProspectsandChallengeswithFoundationModels.https://arxiv.org/abs/2502.13187

[ 4 ] Longchao Da, Minchiuan Gao, Hao Mei, Hua Wei. 2024. Prompt to transfer:Sim-to-real Transfer for Traffic Signal Control with Prompt Learning. In Proceedings of the Thirty-Eighth AAAl Conference on Artificial Intelligence ( AAAl'24 ) .

[ 5 ] Tiejin Chen, Prithvi Parag Shirke, Bharatesh Chakravarthi, Arpitsinh RohitkumarVaghela, Longchao Da, Duo Lu, Yezhou Yang, Hua Wei. SynTraC: A Synthetic Datasetfor Traffic Signal Control from Traffic Monitoring Cameras. In Proceedings of 27th IEEE International Conference on Intelligent Transportation Systems ( ITSC'24 ) .

[ 6 ] Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei. The Sim-to-Real Gap ofFoundation Model Agents: A Unified MDP Perspective. In the Proceedings of the 32nd

SIGKDD Conference on Knowledge Discovery and Data Mining ( KDD'26 ) .

[ 7 ] Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng GaoHaiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu,Ryan A Rossi, Hua Wei, Xiyang Hu. When Simulation Lies: A Sim-to-Real BenchmarkDomain-RandomizedRLTool-UseandRecipeforAgents

https://arxiv.org/abs/2605.11928

[ 8 ] Xiaoou Liu, Longchao Da, Hanyang Chen, Yuan Ling, Hua Wei. AndroidReality:How Far Are Mobile Agents from the Real World? https://arxiv.org/abs/2608.07775

[ 9 ] Xiaoou Liu, Tiejin Chen, Longchao Da, Chacha Chen, Zhen Lin, Hua Wei.

Uncertainty Quantification and Confidence Calibration in Large Language Models: ASurvey. In the Proceedings of the 31st ACM SIGKDD International Conference on

Knowledge Discovery and Data Mining ( KDD'25 ) .

[ 10 ] 播客 : 华几来了 https://linktr.ee/huajilaile

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了  IJCAI 2026 参会群!进群你会解锁这些「福利」?

会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

现场后援团:(会议期间专属开启):到了会场也不用慌——

路线导航:场馆分布、报告厅怎么走,群里随时问;

议题共读:热门 session、Keynote 现场探讨,错过也能追;

Poster 汇编:现场海报精华整理,一键收藏不遗漏;

约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门:  扫码进群或添加微信 Qvv0909777,备注:IJCAI  + 单位 / 学校 + 姓名 + 方向

搞科研 / 搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注雷峰网专区。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 腾讯 美的 物理 不莱梅
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论