量子位 昨天
全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

终于!Agent 赛道,不再是自回归(AR)模型一家独大。

长期处于非主流位置的扩散模型,也开始有了一席之地。

这些年但凡叫得上名字的 Agent,从 ChatGPT 到 Claude,底层清一色因果自回归 LLM。

逐 Token 生成慢是慢了点,但行业默认,Agent 的大脑只能如此。

蚂蚁却不这么想。

旗下 inclusionAI 团队陆续推出 LLaDA 系列模型,最新开源LLaDA2.2,实现扩散模型首次进入智能体长程任务!

准确来说,这是一款千亿参数的 MoE 扩散语言模型,原生支持 128K 上下文,也是全球首个大规模 Agentic 扩散模型。

总之自回归模型能干的,它也能干,自回归模型跑得慢的痛点,它也能一刀切。

更关键的是,它第一次将 Levenshtein 编辑、面向环境反馈的强化学习,以及长上下文工程架构,整合进同一套扩散模型 Agent 系统——

模型不仅能并行生成,还能在生成过程中自我增删动态修正

LLaDA2.2 的出现同样有迹可循,从 2.0 时期的规模化尝试,到 2.1 版本的边写边改,再到如今的智能体觉醒。

半年时间、三代模型,依次完成扩散架构从生成工具到行动架构的递进。

扩散模型破局自回归垄断

其实自回归模型能统治 Agent 赛道这么久,也是有几分道理在的。

多轮对话、工具调用、环境反馈处理,这些任务本身就天然要求模型具备序列因果性。

一个 Token 一个 Token 蹦,逻辑链条才不容易断。

传统扩散模型则可以同时处理一个 block 中的多个位置,速度是比自回归快了,但代价就是 Token 之间彼此缺乏严格的序列条件约束

放在普通文本生成场景里,这些问题倒不算什么,顶多影响一点可读性,读者看到两句重复的话,笑一笑就算了。

但 Agent 场景不一样。

Agent 的输出是要被真实执行的,再小的 bug 也会影响整个流程,一步错步步错,错误会在后续交互中被持续固化成硬约束,最终导致整体目标漂移。

所以扩散模型想在更复杂困难的 Agent 环境中和自回归齐平,就须得迈过这一关。

对此,蚂蚁团队看得很清楚。

LLaDA2.0首先解决的,就是规模化问题。

它证明扩散模型并不是只能停留在小参数实验阶段,也能够与 MoE 等架构结合,真正落地工程。

在验证路线可信的前提下,蚂蚁再顺势推舟给出LLaDA2.1,进一步证明扩散模型边写边改的可用性。

LLaDA2.1 引入 Token-to-Token 编辑机制,可以在生成过程中判断哪些 Token 应该保留,哪些 Token 需要替换。

但到了 Agent,这样的局部修改还远远不够,它需要的是根本性的结构调整,实现边行动边纠错

于是LLaDA2.2来了。

如何做到?三大技术拼图集中发力

LLaDA2.2 的变化集中在三个方面,每一项单点突破固然重要,蚂蚁三合一系统集成在一起才是扩散模型拿到 Agent 入场券的重中之重。

让模型学会自改自生

传统扩散模型块并行解码的最大问题是结构刚性。生成完一个 block,里面的 Token 就被钉死了。

要是错了,只能整段重来,长了也没法删,短了更没法补。

LLaDA2.2 采用Levenshtein 编辑范式,在块内支持四种原子操作:KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)。

然后通过 LCS 最长公共子序列将块内草稿与目标序列对齐,动态生成编辑标签。

翻译一下就是,模型现在能对自己的生成结果修正了。

看到冗余的内容,直接 DELETE 切掉,发现缺了关键信息,INSERT 可以在指定位置开一个口子,后续去噪轮次往里填。

这也是业界第一次把 Levenshtein 编辑大规模集成到扩散模型的去噪过程中,效果立竿见影。

实验显示,在 SWE-bench Verified 上,仅开启 Levenshtein 编辑这一项,就带来了从 35.8 到 44.4,整整8.6个百分点的绝对提升。

让模型学会看环境反馈

除了结构刚性问题,扩散模型还有一个更为隐蔽的坑。

长程 Agent 交互中,早期 block 的微小偏差会被后续上下文不断放大。一旦返回了错误结果,模型再用这个错误结果去规划下一步,推理路径就会越走越窄。

ICML 2026 的最佳论文还专门讨论过这个问题,它有一个专门的名字:模型崩溃(Model Collapse)。

常规修正方法是在错误外面包一层修正指令,显然这样做治标不治本。

LLaDA2.2 提出的L-EBPO(Levenshtein Editing Evidence Lower Bound Policy Optimization),可以把多轮交互中的 Levenshtein 编辑决策建模为强化学习问题。

模型会根据环境反馈,自主决策什么时候 DELETE 切除病灶、什么时候 INSERT 填补缺失。

如果说 Levenshtein 编辑范式是给了扩散模型一双手,L-EBPO 就是添上了眼睛,让模型能实时看到自己的错误,知道从哪里做、做完效果如何。

让模型支撑长程 Agent 任务

解决完质量问题后,摆在扩散模型面前的还有最后一道坎——工程应用

Agent 任务普遍需要处理超长上下文,上下文窗口不够大,Agent 就举步维艰。

LLaDA2.2 通过渐进式长上下文训练,一步步把原生上下文窗口从 8K、64K 撑到了128K

随之而来的是另一重问题:标准 MoE 为 Token 级路由,每个 Token 独立选择专家,总激活专家集合极大,HBM 流量、通信开销暴涨,推理成本飙升。

LLaDA2.2 的解法是BlockRouting

先在 block 层面精准筛选 top-C 个专家形成固定专家池,再内部执行 Token 级 top-k 路由,屏蔽池外专家。

这样每块激活专家上限恒定,HBM 流量与专家并行通信成本得以大幅降低。

由此,128K 原生上下文 +BlockRouting 机制让 Agentic 扩散模型真正具备了工程部署价值。

那么效果如何呢?

且看七大 Agent 基准上,LLaDA 2.2-flash 与顶尖自回归模型Ling-2.6-flash正面竞技,平均分为 53.83 vs 55.74,差距缩小到 2 分以内。

严格来说,还没有完全跑赢,但二者已处于相近水平

进一步拆开看,LLaDA 2.2 在 τ² -Bench、PinchBench、MCP-Atlas 三项交互式任务上实现反超,说明它在偏向真实交互的 Agent 场景中已经开始展现竞争力。

效率方面则更干脆,在 11 类工作负载上,LLaDA2.2-flash 的 BF16 平均吞吐量可达 Ling-2.6-flash 的 1.64 倍,量化至 FP8 后,平均吞吐量还可以额外提升18.6%

同时结合此前已知的原生 128K 上下⽂窗⼝,LLaDA2.2 的优势在于,能力接近自回归模型,速度更优。

而这才是 LLaDA2.2 最值得关注的地方,它证明扩散模型同样可以和自回归模型站在同一条起跑线上。

Agent 时代,需要自回归与扩散双轨并行

诚然,LLaDA2.2 并没有终结自回归模型统治。

在严格结构化输出和复杂代码生成中,自回归模型依然拥有更成熟的能力。

但 LLaDA2.2 的价值不在输赢,它所抛出的行业观察才是核心:纯自回归模型不是绝对选项

过去 Agent 的主流架构几乎被自回归接管,但对 Agent 来说,当它真正进入物理世界,它需要的就不会只有更高的智力上限。

比如一个部署在工厂车间里的 Agent,响应延迟每多一秒,产线停摆的成本就多一分;再比如一个运行在端侧设备上的 Agent,推理成本每高一点,大规模落地的门槛就高一截。

速度、成本,这些恰恰是扩散架构的优势所在。

它和自回归模型也不是非此即彼,相反后 Agent 时代可能同时需要它们:

需要生成严格工具参数、执行强因果流程时,可以由自回归稳步推进;需要快速探索、并行生成时,可以让扩散介入。

两种机制融合,在同一个 Agent 系统里各司其职,然后根据任务阶段动态切换,这才是 LLaDA2.2 所预示的未来。

老话常说,两条腿走路,才能走得更远。

自回归模型已经铺好了一条成熟轨道,LLaDA2.2 正在尝试铺设另一条:

最终双轨并行

技术报告:https://github.com/inclusionAI/LLaDA2.X/blob/main/LLaDA2_2_tech_report.pdf

GitHub 链接:https://github.com/inclusionAI/LLaDA2.X

HuggingFace 链接:https://huggingface.co/inclusionAI/LLaDA2.2-flash

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ar 准确 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论