AI科技评论 8小时前
蚂蚁集团 IJCAI 2026 论文盘点:让 AI 学会「随机应变」
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

再聪明的算法,终归要回到动态环境中检验。

作者丨幸丽娟

编辑丨齐铖湧

IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。大会召开之际,AI 科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。

在上一篇中,我们观察到了大厂在参数竞赛上的克制,以及对算力效率的追求。

而蚂蚁集团入选的四篇论文,则指向了一条同样重要但路径截然不同的技术脉络:对动态环境适应能力的系统性探索。

算法模型的精度在实验室里不断刷新纪录,但一旦部署到真实世界,性能衰减几乎成为常态。原因很简单:真实世界从来不是静止的。

蚂蚁集团的业务场景,将这种 " 不静止 " 推向了极致:超 10 亿用户、8000 多种服务,支付洪峰与凌晨低谷之间可以差出几个数量级,风控模型必须以小时级响应黑产策略的迭代,全球化部署还要适配各国迥异的金融基础设施。

在这样的环境里," 一次训练、永久部署 " 的静态模型,注定陷入 " 刻舟求剑 " 的困境。

也正因此,真正的智能,在于算法能否感知环境变化、主动调整自身策略、在动态中寻找最优解。蚂蚁集团这四篇论文,不约而同地回答了这个核心命题:如何让 AI 从 " 静态的求解器 " 进化为"动态的自适应者"?

01

MSRGC-Net:让时间序列

聚类 " 自适应 " 数据密度分布

时间序列聚类,就是把海量行为序列自动归类,这是一种理解行为模式、监控异常信号的基础工具。

但现有方法各有各的尴尬:

相似度方法(如 k-Shape):能抓局部模式,但要算所有样本两两之间的距离,数据一多就跑不动了;

深度学习方法(如自编码器):表征能力强,但训练贵、调参烦、算力消耗大;

传统特征提取:依赖人工设计特征,关键的时间动态信息可能被丢掉。

更大的问题是:现实中的时序数据密度分布极不均匀——双十一交易数据密集如暴雨,凌晨数据则稀疏如滴水,但传统方法需要你提前告诉它分成几类,这本身就与现实错位。

蚂蚁集团联合重庆邮电大学提出的 MSRGC-Net,用一套 " 无训练 " 的组合拳,绕开了精准度和计算效率之间的两难选择。

论文地址:https://arxiv.org/pdf/2606.12077v1

它的核心逻辑可以拆成三步:

第一步,多尺度储备池编码(特征提取)。使用多个无需训练的回声状态网络(ESN)作为储备池计算的基本单元,仅靠调整谱半径就能从原始时序中同时提取局部波动和长期趋势,将所有样本聚合后形成视图特征矩阵 ,作为后续环节的输入。

第二步,"颗粒球 " 锚定图构建(结构建模),这是最巧妙的部分。算法不再盯着单个数据点,而是根据数据的局部密度自动划分 " 颗粒球 "(Granular Ball):密度高的区域形成小而多的颗粒,密度低的区域形成大而少的颗粒。数据规模从 N 压缩到 M(颗粒数,M < N),同时噪声干扰也被抑制。

第三步,基于共识的多尺度图优化。跨尺度的锚定图通过共识策略融合,使模型既能捕获微观局部模式,又能把握宏观全局趋势,最终生成无需人工指定聚类数目的鲁棒聚类结果。

这套打法效果如何?

在 5 个多变量基准数据集、15 项评估指标(NMI、ARI、RI 各 5 项)上,MSRGC-Net 拿了 12 项最优、2 项第二—— 80% 的最优率。

更关键的是,它避开了 O ( n ² ) 的成对计算,实现了近线性的复杂度。简单说就是:又快又准,而且不需要你猜要分几类。

在蚂蚁的实际业务场景中,这意味着系统能根据流量密度自动调整聚类粒度——高峰时精细分群抓异常,低谷时粗粒度概括省算力,始终跟着数据走。

02

让离线到在线强化

学习 " 自适应 " 数据混合策略

强化学习有个著名的 " 水土不服 " 问题—— " 分布偏移 ":在离线数据上训练好的模型,一上线就容易 " 失忆 "。这是因为离线数据和在线交互数据之间存在分布差异,导致在线初期策略迅速 " 遗忘 " 离线学到的知识。

现有的解决办法无非两种:要么固定 50% 离线 +50% 在线这样的混合比例,要么用启发式规则优先采样 " 近策略 " 的样本。

但问题是,策略在不同阶段的需求完全不一样——早期需要更多离线数据稳住基本盘,后期需要更多在线数据探索新可能。固定策略,就是刻舟求剑。

蚂蚁集团联合上海交通大学提出 ROAD ,把数据混合比例从一个 " 预设参数 " 变成了"动态决策变量"。

论文地址:https://arxiv.org/pdf/2605.14497

它的核心思想很有意思:数据选择本质上是个双层优化问题。

内层(Inner-Level):标准的 Q 学习更新,即最小化贝尔曼误差;

外层(Outer-Level):将数据混合策略视为元决策变量,以最大化在线策略的预期回报为目标。

两层通过多臂老虎机 MAB ( Multi-Armed Bandit)算法近似求解,使得混合策略能够在训练过程中实时调整:一旦发现模型开始 " 遗忘 " 离线阶段学到的知识,就自动调高离线数据的采样比例来稳住基本盘;当模型趋于保守、探索不足时,又及时增加在线数据的占比,鼓励它去试错。

实验做得挺扎实。团队在离线到在线强化学习的三大经典基准上进行了验证:AntMaze(机器人在迷宫中寻找目标)、MuJoCo(仿生机器人的运动控制)和 FrankaKitchen(机械臂在厨房中完成复杂操作)。这些任务难度不同、状态空间各异,能比较全面地检验算法的泛化能力。

为验证 ROAD 的算法普适性,研究团队 ROAD 和 IQL、PEX、CQL、Cal-QL 等多种主流离线算法 " 嫁接 " 在一起。结果显示:无论底层用哪种算法,ROAD 都能稳定带来性能提升。

以 PEX+ROAD 为例,该方法在 D4RL 基准的 24 个连续控制任务上取得了 71.12 的总体平均分,24 个任务里有 18 个排第一,显著优于固定比例、递减比例、启发式平衡回放等所有基线。

也就是说,ROAD 能够让模型在 " 保守继承 " 和 " 激进探索 " 之间找到了最优平衡点——既不会一上线就翻车,也不会错失实时数据带来的提升机会。该方法对蚂蚁集团风控模型上线、推荐系统实时优化这类场景而言,价值很鲜明。

03

DSEBO:让高维贝叶斯

优化 " 自适应 " 搜索子空间

贝叶斯优化是黑盒函数优化的经典方法,但一碰到高维问题就头疼。一种常见解法是随机嵌入——把优化投射到低维子空间,但新问题来了:有效维度到底是多少?

传统方法要么依赖专家经验给定固定子空间维度,要么通过试错法反复估计,不仅消耗大量资源,且固定的子空间维度难以适配不同任务。更麻烦的是,有效维度本身可能随优化进程变化:初期探索时低维度就够用,后期精调时可能需要更高维度的细节。

蚂蚁集团联合华东师范大学、南京大学提出的 DSEBO,让子空间维度成为优化进程中的 " 动态变量 ",随搜索进度自主切换。

论文地址:https://arxiv.org/pdf/2605.23473

DSEBO 的核心机制是 " 从低到高,逐级跃升 ":

低维子空间出发,优化器在低维空间生成候选解,经随机嵌入映射至原始空间,并快速摸清目标函数的大致轮廓,然后结果反馈驱动高斯过程迭代更新;

观察到收敛后自动触发维度扩展,通过共享嵌入矩阵把低维解 " 继承 " 到高维;

新子空间初始化和继续优化,由共享嵌入矩阵确保各子空间相互嵌套,形成 " 低维探索→收敛触发→维度扩展→继续优化 " 的循环,直到达到评估预算上限。

其中维度扩展环节,扩展幅度也不是固定的——算法会根据当前最优值变化曲线自适应调整:曲线平缓就慢点扩,省不必要的开销;曲线陡峭就快点扩,快速捕捉高维增益。

实验结果是:在合成函数(Levy、Griewank、Sphere,D=1000)和三个真实任务(MSLR、Lasso-Hard、LIMO)上,DSEBO 与 REMBO、SIRBO、BAxUS、TuRBO 等十几种主流方法逐一对比,几乎所有任务上都拿下了最优解——精度和收敛速度双双领先。

这套 " 低维探路、高维精调 " 的打法,在蚂蚁的日常研发中也很实用——信贷模型的超参数调优、风控策略的阈值寻优、营销活动的多变量实验设计,不再需要专家拍脑袋估计维度了,算法自己会 " 边走边看 ",实现了自动化、高效率的运行。

04

VGA-BenchV2:让视频评估

基准 " 自适应 "AIGC 生态的进化

如果说前三篇论文讨论的是算法层面的自适应,那么 VGA-BenchV2 展示的是评估基础设施如何 " 自适应 "AIGC 技术生态的迭代。这也是四篇论文中唯一聚焦多模态内容理解的工作,映射了蚂蚁集团在数字生活、内容生态等非金融领域的战略储备。

AIGC 让视频生产大爆发,但一个核心问题卡住了:我们怎么系统性评估这些生成视频的质量?

传统评估指标如 FVD(评估整体质量与时序连贯性)CLIP Score(评估生成图像与文字描述的语义一致性),主要看画面清不清晰、动作连不连贯、文本对不对得上。至于构图精不精妙、光影讲不讲究、色彩和不和谐——这些关乎 " 美感 " 的感知品质,它们几乎无能为力。

此前 CVPR 2026 上,蚂蚁联合北京电影学院、通用人工智能研究院(BIGAI)提出了 VGA-Bench,首次为视频审美评估建立了三维度框架(美学质量、美学标签、生成质量),并基于 1016 个提示词、12 个生成模型、超 6 万个视频构建了评估基准,让 AI 第一次学会了从专业视角 " 鉴赏 " 视频。

论文链接:https://arxiv.org/pdf/2604.10127

但视频生成模型进化太快,以月为单位的迭代节奏让固定基准很快就 " 不够用了 "。在这篇 IJCAI 2026 论文中,团队又进一步推出 VGA-BenchV2。

开源地址:

https://huggingface.co/datasets/BestVictoryLab/VGA-Bench

核心进化有三点:

第一,人工标注量级增加VGA-BenchV2 新增了 36,000 条任务级人工标注,其中美学质量标注 16,200 条、美学标签标注 13,200 条、生成质量标注 6,600 条,相比 VGA-Bench 分别实现了 13.46 倍、11.15 倍和 1.55 倍的扩展。更充足的 " 人类偏好 " 数据,让评估器与人的审美判断对齐得更准。

第二,评估器架构升级团队设计了混合架构:VAQA-Net 负责连续美学评分,VTag-Net 和 VGQA-Net 基于 Qwen 大视觉语言模型进行标签识别和质量评估。大模型的引入,让评估器对复杂视觉语义的理解上了一个台阶。实验结果表明,其在多个生成模型上的评估结果与人类判断高度一致。

第三,从 " 评估 " 到 " 优化 "的闭环打通。 这是 VGA-BenchV2 最具突破性的设计:它将学到的美学评估器作为奖励信号,直接用于强化学习的生成模型微调。这意味着评估基准不再只是 " 裁判员 ",它给出的分数可以直接转化为优化信号,指导生成模型在美学质量上持续迭代。

VGA-Bench 到 VGA-BenchV2,评估体系不再是静态的标尺,而是与生成生态 " 共进化 " 的活系统。对于蚂蚁集团的内容理解、安全审核、推荐优化等场景而言,视频质量评估能力不仅能跟上 AIGC 生态的演进,还能反过来驱动上游模型的优化:从 " 打分 " 到 " 优化 ",闭环就此形成。

结束语:再聪明的算法,

终归要回到动态环境中检验

四篇论文分别从无监督学习、强化学习、黑盒优化和多模态评估四个方向切入,共同指向了同一个技术路径——从静态到动态的范式转换。

实验数据也印证了这条路径的有效性:MSRGC-Net 在 15 项指标中拿下 12 个第一、2 个第二;ROAD 在多类离线到在线强化学习任务中超越现有策略;DSEBO 在千维优化问题上实现了可量化的改进;VGA-BenchV2 在多个生成模型上的评估结果与人类判断高度一致。

顺着这条技术路径再看蚂蚁的整体布局,会发现一个清晰的 " 双轮驱动 " 结构:一面在金融核心场景中深耕时序建模、强化学习和优化算法;一面在数字生活与内容生态中前瞻布局多模态理解与评估基础设施。

说到底,算法再聪明,终归要回到动态的环境中检验。这四篇论文的真正价值,或许正在于它们都生长在真实的业务土壤里:蚂蚁的业务场景不是论文的 " 背景板 ",而是问题的来源、数据的产地和效果的检验

而这或许,正是工业界做 AI 研究最独特的地方——他们不只是在 " 做论文 ",更是在为真实世界的问题,找 " 能抗住动态变化 " 的解法。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

现场后援团:(会议期间专属开启):到了会场也不用慌——

路线导航场馆分布、报告厅怎么走,群里随时问;

议题共读热门 session、Keynote 现场探讨,错过也能追;

Poster 汇编现场海报精华整理,一键收藏不遗漏;

约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信 Qvv0909777,备注:IJCAI+ 单位 / 学校 + 姓名 + 方向

搞科研 / 搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

蚂蚁集团 竞赛 全球化 基础设施
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论