再聪明的算法,终归要回到动态环境中检验。
作者丨幸丽娟
编辑丨齐铖湧
IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。大会召开之际,AI 科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。
在上一篇中,我们观察到了大厂在参数竞赛上的克制,以及对算力效率的追求。
而蚂蚁集团入选的四篇论文,则指向了一条同样重要但路径截然不同的技术脉络:对动态环境适应能力的系统性探索。
算法模型的精度在实验室里不断刷新纪录,但一旦部署到真实世界,性能衰减几乎成为常态。原因很简单:真实世界从来不是静止的。
蚂蚁集团的业务场景,将这种 " 不静止 " 推向了极致:超 10 亿用户、8000 多种服务,支付洪峰与凌晨低谷之间可以差出几个数量级,风控模型必须以小时级响应黑产策略的迭代,全球化部署还要适配各国迥异的金融基础设施。
在这样的环境里," 一次训练、永久部署 " 的静态模型,注定陷入 " 刻舟求剑 " 的困境。
也正因此,真正的智能,在于算法能否感知环境变化、主动调整自身策略、在动态中寻找最优解。蚂蚁集团这四篇论文,不约而同地回答了这个核心命题:如何让 AI 从 " 静态的求解器 " 进化为"动态的自适应者"?
01
MSRGC-Net:让时间序列
聚类 " 自适应 " 数据密度分布
时间序列聚类,就是把海量行为序列自动归类,这是一种理解行为模式、监控异常信号的基础工具。
但现有方法各有各的尴尬:
相似度方法(如 k-Shape):能抓局部模式,但要算所有样本两两之间的距离,数据一多就跑不动了;
深度学习方法(如自编码器):表征能力强,但训练贵、调参烦、算力消耗大;
传统特征提取:依赖人工设计特征,关键的时间动态信息可能被丢掉。
更大的问题是:现实中的时序数据密度分布极不均匀——双十一交易数据密集如暴雨,凌晨数据则稀疏如滴水,但传统方法需要你提前告诉它分成几类,这本身就与现实错位。
蚂蚁集团联合重庆邮电大学提出的 MSRGC-Net,用一套 " 无训练 " 的组合拳,绕开了精准度和计算效率之间的两难选择。
论文地址:https://arxiv.org/pdf/2606.12077v1
▎它的核心逻辑可以拆成三步:
第一步,多尺度储备池编码(特征提取)。使用多个无需训练的回声状态网络(ESN)作为储备池计算的基本单元,仅靠调整谱半径就能从原始时序中同时提取局部波动和长期趋势,将所有样本聚合后形成视图特征矩阵 ,作为后续环节的输入。
第二步,"颗粒球 " 锚定图构建(结构建模),这是最巧妙的部分。算法不再盯着单个数据点,而是根据数据的局部密度自动划分 " 颗粒球 "(Granular Ball):密度高的区域形成小而多的颗粒,密度低的区域形成大而少的颗粒。数据规模从 N 压缩到 M(颗粒数,M < N),同时噪声干扰也被抑制。
第三步,基于共识的多尺度图优化。跨尺度的锚定图通过共识策略融合,使模型既能捕获微观局部模式,又能把握宏观全局趋势,最终生成无需人工指定聚类数目的鲁棒聚类结果。
这套打法效果如何?
在 5 个多变量基准数据集、15 项评估指标(NMI、ARI、RI 各 5 项)上,MSRGC-Net 拿了 12 项最优、2 项第二—— 80% 的最优率。
更关键的是,它避开了 O ( n ² ) 的成对计算,实现了近线性的复杂度。简单说就是:又快又准,而且不需要你猜要分几类。
在蚂蚁的实际业务场景中,这意味着系统能根据流量密度自动调整聚类粒度——高峰时精细分群抓异常,低谷时粗粒度概括省算力,始终跟着数据走。
02
让离线到在线强化
学习 " 自适应 " 数据混合策略
强化学习有个著名的 " 水土不服 " 问题—— " 分布偏移 ":在离线数据上训练好的模型,一上线就容易 " 失忆 "。这是因为离线数据和在线交互数据之间存在分布差异,导致在线初期策略迅速 " 遗忘 " 离线学到的知识。
现有的解决办法无非两种:要么固定 50% 离线 +50% 在线这样的混合比例,要么用启发式规则优先采样 " 近策略 " 的样本。
但问题是,策略在不同阶段的需求完全不一样——早期需要更多离线数据稳住基本盘,后期需要更多在线数据探索新可能。固定策略,就是刻舟求剑。
蚂蚁集团联合上海交通大学提出 ROAD ,把数据混合比例从一个 " 预设参数 " 变成了"动态决策变量"。
论文地址:https://arxiv.org/pdf/2605.14497
它的核心思想很有意思:数据选择本质上是个双层优化问题。
内层(Inner-Level):标准的 Q 学习更新,即最小化贝尔曼误差;
外层(Outer-Level):将数据混合策略视为元决策变量,以最大化在线策略的预期回报为目标。
两层通过多臂老虎机 MAB ( Multi-Armed Bandit)算法近似求解,使得混合策略能够在训练过程中实时调整:一旦发现模型开始 " 遗忘 " 离线阶段学到的知识,就自动调高离线数据的采样比例来稳住基本盘;当模型趋于保守、探索不足时,又及时增加在线数据的占比,鼓励它去试错。
实验做得挺扎实。团队在离线到在线强化学习的三大经典基准上进行了验证:AntMaze(机器人在迷宫中寻找目标)、MuJoCo(仿生机器人的运动控制)和 FrankaKitchen(机械臂在厨房中完成复杂操作)。这些任务难度不同、状态空间各异,能比较全面地检验算法的泛化能力。
为验证 ROAD 的算法普适性,研究团队 ROAD 和 IQL、PEX、CQL、Cal-QL 等多种主流离线算法 " 嫁接 " 在一起。结果显示:无论底层用哪种算法,ROAD 都能稳定带来性能提升。
以 PEX+ROAD 为例,该方法在 D4RL 基准的 24 个连续控制任务上取得了 71.12 的总体平均分,24 个任务里有 18 个排第一,显著优于固定比例、递减比例、启发式平衡回放等所有基线。
也就是说,ROAD 能够让模型在 " 保守继承 " 和 " 激进探索 " 之间找到了最优平衡点——既不会一上线就翻车,也不会错失实时数据带来的提升机会。该方法对蚂蚁集团风控模型上线、推荐系统实时优化这类场景而言,价值很鲜明。
03
DSEBO:让高维贝叶斯
优化 " 自适应 " 搜索子空间
贝叶斯优化是黑盒函数优化的经典方法,但一碰到高维问题就头疼。一种常见解法是随机嵌入——把优化投射到低维子空间,但新问题来了:有效维度到底是多少?
传统方法要么依赖专家经验给定固定子空间维度,要么通过试错法反复估计,不仅消耗大量资源,且固定的子空间维度难以适配不同任务。更麻烦的是,有效维度本身可能随优化进程变化:初期探索时低维度就够用,后期精调时可能需要更高维度的细节。
蚂蚁集团联合华东师范大学、南京大学提出的 DSEBO,让子空间维度成为优化进程中的 " 动态变量 ",随搜索进度自主切换。
论文地址:https://arxiv.org/pdf/2605.23473
DSEBO 的核心机制是 " 从低到高,逐级跃升 ":
从低维子空间出发,优化器在低维空间生成候选解,经随机嵌入映射至原始空间,并快速摸清目标函数的大致轮廓,然后结果反馈驱动高斯过程迭代更新;
观察到收敛后自动触发维度扩展,通过共享嵌入矩阵把低维解 " 继承 " 到高维;
新子空间初始化和继续优化,由共享嵌入矩阵确保各子空间相互嵌套,形成 " 低维探索→收敛触发→维度扩展→继续优化 " 的循环,直到达到评估预算上限。
其中维度扩展环节,扩展幅度也不是固定的——算法会根据当前最优值变化曲线自适应调整:曲线平缓就慢点扩,省不必要的开销;曲线陡峭就快点扩,快速捕捉高维增益。
实验结果是:在合成函数(Levy、Griewank、Sphere,D=1000)和三个真实任务(MSLR、Lasso-Hard、LIMO)上,DSEBO 与 REMBO、SIRBO、BAxUS、TuRBO 等十几种主流方法逐一对比,几乎所有任务上都拿下了最优解——精度和收敛速度双双领先。
这套 " 低维探路、高维精调 " 的打法,在蚂蚁的日常研发中也很实用——信贷模型的超参数调优、风控策略的阈值寻优、营销活动的多变量实验设计,不再需要专家拍脑袋估计维度了,算法自己会 " 边走边看 ",实现了自动化、高效率的运行。
04
VGA-BenchV2:让视频评估
基准 " 自适应 "AIGC 生态的进化
如果说前三篇论文讨论的是算法层面的自适应,那么 VGA-BenchV2 展示的是评估基础设施如何 " 自适应 "AIGC 技术生态的迭代。这也是四篇论文中唯一聚焦多模态内容理解的工作,映射了蚂蚁集团在数字生活、内容生态等非金融领域的战略储备。
AIGC 让视频生产大爆发,但一个核心问题卡住了:我们怎么系统性评估这些生成视频的质量?
传统评估指标如 FVD(评估整体质量与时序连贯性)CLIP Score(评估生成图像与文字描述的语义一致性),主要看画面清不清晰、动作连不连贯、文本对不对得上。至于构图精不精妙、光影讲不讲究、色彩和不和谐——这些关乎 " 美感 " 的感知品质,它们几乎无能为力。
此前 CVPR 2026 上,蚂蚁联合北京电影学院、通用人工智能研究院(BIGAI)提出了 VGA-Bench,首次为视频审美评估建立了三维度框架(美学质量、美学标签、生成质量),并基于 1016 个提示词、12 个生成模型、超 6 万个视频构建了评估基准,让 AI 第一次学会了从专业视角 " 鉴赏 " 视频。
论文链接:https://arxiv.org/pdf/2604.10127
但视频生成模型进化太快,以月为单位的迭代节奏让固定基准很快就 " 不够用了 "。在这篇 IJCAI 2026 论文中,团队又进一步推出 VGA-BenchV2。
开源地址:
https://huggingface.co/datasets/BestVictoryLab/VGA-Bench
▎核心进化有三点:
第一,人工标注量级增加。VGA-BenchV2 新增了 36,000 条任务级人工标注,其中美学质量标注 16,200 条、美学标签标注 13,200 条、生成质量标注 6,600 条,相比 VGA-Bench 分别实现了 13.46 倍、11.15 倍和 1.55 倍的扩展。更充足的 " 人类偏好 " 数据,让评估器与人的审美判断对齐得更准。
第二,评估器架构升级。团队设计了混合架构:VAQA-Net 负责连续美学评分,VTag-Net 和 VGQA-Net 基于 Qwen 大视觉语言模型进行标签识别和质量评估。大模型的引入,让评估器对复杂视觉语义的理解上了一个台阶。实验结果表明,其在多个生成模型上的评估结果与人类判断高度一致。
第三,从 " 评估 " 到 " 优化 "的闭环打通。 这是 VGA-BenchV2 最具突破性的设计:它将学到的美学评估器作为奖励信号,直接用于强化学习的生成模型微调。这意味着评估基准不再只是 " 裁判员 ",它给出的分数可以直接转化为优化信号,指导生成模型在美学质量上持续迭代。
VGA-Bench 到 VGA-BenchV2,评估体系不再是静态的标尺,而是与生成生态 " 共进化 " 的活系统。对于蚂蚁集团的内容理解、安全审核、推荐优化等场景而言,视频质量评估能力不仅能跟上 AIGC 生态的演进,还能反过来驱动上游模型的优化:从 " 打分 " 到 " 优化 ",闭环就此形成。
结束语:再聪明的算法,
终归要回到动态环境中检验
四篇论文分别从无监督学习、强化学习、黑盒优化和多模态评估四个方向切入,共同指向了同一个技术路径——从静态到动态的范式转换。
实验数据也印证了这条路径的有效性:MSRGC-Net 在 15 项指标中拿下 12 个第一、2 个第二;ROAD 在多类离线到在线强化学习任务中超越现有策略;DSEBO 在千维优化问题上实现了可量化的改进;VGA-BenchV2 在多个生成模型上的评估结果与人类判断高度一致。
顺着这条技术路径再看蚂蚁的整体布局,会发现一个清晰的 " 双轮驱动 " 结构:一面在金融核心场景中深耕时序建模、强化学习和优化算法;一面在数字生活与内容生态中前瞻布局多模态理解与评估基础设施。
说到底,算法再聪明,终归要回到动态的环境中检验。这四篇论文的真正价值,或许正在于它们都生长在真实的业务土壤里:蚂蚁的业务场景不是论文的 " 背景板 ",而是问题的来源、数据的产地和效果的检验场。
而这或许,正是工业界做 AI 研究最独特的地方——他们不只是在 " 做论文 ",更是在为真实世界的问题,找 " 能抗住动态变化 " 的解法。
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信 Qvv0909777,备注:IJCAI+ 单位 / 学校 + 姓名 + 方向。
搞科研 / 搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。


登录后才可以发布评论哦
打开小程序可以发布评论哦