8 月 7 日蚂蚁集团开源了多智能体协作基础设施 Avernet,社区版本已上线,Apache 2.0 协议。这两天转载不少,通稿口径高度一致,都在说 " 发现、共识、跨团队协作与治理 "。
我盯着通稿末尾那句数据看了半天:
截至 2026 年 7 月 31 日,Avernet 相关能力已在蚂蚁集团内部覆盖 12 个核心业务板块,智能体任务完成率稳定超过 90%。
这是一个诚实的数字。也正因为诚实,它值得被认真读一遍。
先说清楚事实
来源:蚂蚁集团 2026-08-07 开源公告,经 ITBEAR、搜狐 IT、TechWeb、华西计算机研报等多方转载核实。
开源时间:2026 年 8 月 7 日,社区版本已上线
协议:Apache 2.0
定位:多智能体协作基础设施,不绑定单一模型或智能体引擎
要解决的四类问题(原文用词):找不到、对不齐、跑不快、留不住
本次开放:智能体协作网络能力;身份认证、访问授权、权限控制、生命周期管理及部分安全防护
后续开放:审计追踪、可观测与评测、记忆与持续优化、服务化与容器集群管理
内部数据:截至 2026-07-31,覆盖 12 个核心业务板块,任务完成率稳定超 90%
90% 这个数,得换个方向读
在企业级系统里,90% 的任务完成率是个什么水平?
单看不低。多智能体协作涉及跨系统调用、权限校验、多方共识,能稳定在 90% 以上说明工程做扎实了。蚂蚁敢把这个数写进通稿,我认为是加分项——大多数公司在这个阶段只会说 " 效果显著 "。
但换个方向:10% 的任务没完成。
关键问题不在这 10% 有多大,而在于——它们是怎么没完成的?
这里有一个绝大多数人没意识到的区别。传统软件系统失败,会抛异常、会中断、会给你一个明确的错误码,你知道它挂了。而智能体任务的 " 未完成 ",形态要复杂得多,至少三种:
明确失败——超时、报错、工具调用挂了。这种最好,因为它可见。
卡住不动——两个智能体互相等对方的输出,谁也不往下走。这种能靠超时兜住。
完成了,但结果是错的——这种最要命。任务状态显示成功,产出物看着也像那么回事,只有下游用的时候才发现不对。
而 " 任务完成率 " 这个指标,天然只能统计第 1 类和第 2 类。第 3 类在统计口径里是成功。
所以我的判断是:真实可用率,一定低于任何一家公司公布的任务完成率。 这不是质疑蚂蚁,这是所有智能体系统的共同属性——你没法用一个布尔值去度量一件本质上有质量梯度的事。
顺带说一句,蚂蚁后续要开放的能力清单里,第一个就是审计追踪和可观测与评测。这个排序本身就说明问题:他们清楚现在最缺的是什么。
真正的干货在那八个字
通稿里最实在的是这四个词:找不到、对不齐、跑不快、留不住。
我把它翻译成技术人员每天真实遇到的场景:
找不到:隔壁组去年做了个能干这活的智能体,你不知道,于是又造了一个。三个月后公司里有四个功能重合的智能体。
对不齐:A 智能体产出的格式,B 智能体读不了。中间必须有个人手动转一道。
跑不快:任务在流程中间需要人工转交,一个环节等审批等两小时,整条链路的延迟全花在等人上。
留不住:这次踩的坑、调好的提示词、验证过的流程,全在某个人的聊天记录里,人一走全没了。
这四个问题,把 " 智能体 " 三个字去掉,全部成立。
这就是任何一家超过 50 人的公司都存在的组织协同问题:能力找不到、接口对不齐、流程等审批、经验留不下。
我的核心判断是:Avernet 本质上不是一个 AI 框架,是一套组织管理制度的代码实现。
它做身份认证、访问授权、权限控制、生命周期管理——这些词你在任何一本企业 IT 治理的书里都能找到。区别只在于,过去这些制度约束的对象是人和系统账号,现在多了一类对象:智能体。
而通稿里有一句话,我认为是全文最有分量的:
在企业中,数据受到隐私、合规和业务边界约束,难以将所有信息和权限集中交给一个 " 超级智能体 "。
这句话是在否定一条流行路线。
过去两年很多人的设想是:搞一个什么都知道、什么都能干的超级智能体,接管全公司。蚂蚁在这里明确说了这条路走不通,理由不是技术不够,而是隐私、合规和业务边界——这三样东西不会因为你的模型变强而消失。
风控的数据法务不能随便看,用户信息跨境有规定,某些业务线之间必须做隔离墙。这些约束是外生的、刚性的。
所以结论只能是:不是一个全知全能的大脑,而是一堆各自受限、按规则协作的小脑袋。
这个判断我完全认同。而且我要补一句:这恰恰说明,多智能体架构不是因为技术上更优雅才被选择的,是因为合规上没有别的选择。
老金的判断
三点,说得直接些。
第一,这个开源的诚意要看后续版本,不看现在。
现在开放的是协作网络能力和部分治理能力。而生产环境真正离不开的东西——审计追踪、可观测与评测、容器集群管理——都在 " 后续版本 " 里。
我不觉得这是藏私。分批开源是正常节奏,而且蚂蚁把路线图写清楚了,比含糊其辞强。但作为要做技术选型的人,你得清楚:现在拿到手的是骨架,不是整机。 如果你要在三个月内上生产,缺的那几块得你自己补。
第二,Apache 2.0 这个协议选得实在。
这是最宽松的主流开源协议之一,允许商用、允许闭源修改、只要保留版权声明。相比某些 " 开源但商用要授权 " 的协议,这个选择对企业用户友好得多。这一点值得肯定。
第三,也是我最想说的—— 12 个业务板块这个数,比 90% 更有说服力。
为什么?因为内部跑通 12 个核心业务板块,意味着它扛过了真实的组织政治。
写代码的人都懂,让不同团队接入同一套基础设施,技术难度可能只占三成,剩下七成是协调:凭什么用你的?我的系统改造谁出人力?出了问题算谁的?
一套东西能在一家几万人的公司里横穿 12 个核心板块,说明它不只是能跑,是能被别人接受。这个信号比任何 benchmark 都硬。
三条可操作的建议
一、别急着装 Avernet,先做一次 " 智能体盘点 "。
四个问题,一张表就能列完:
公司内部现在总共有多少个在跑的智能体 /AI 工具?
每一个是谁负责的、用的什么模型、月成本多少?
每一个有没有独立的身份标识和权限清单?
有没有两个以上功能重合的?
我的经验是,超过 200 人的公司做这个盘点,八成会发现重复建设。这一步不需要任何新框架,一周就能做完,而且不做这一步,你装什么协作平台都是在混乱之上叠一层混乱。
二、现在就给每个智能体建立独立身份,别共用账号。
这是从蚂蚁那句 " 它是谁、能看什么、能做什么 " 直接抄来的。落到实处:
每个智能体一个独立服务账号,不复用人的账号,更不共用一个万能 Key
权限按最小必要授予,明确写清能访问哪些库、哪些接口、能不能写
所有操作留日志,且日志里要能追溯到具体是哪个智能体的哪次任务
为什么现在就做?因为这件事越晚做成本越高。等你有 30 个智能体全在共用一个数据库账号的时候再去拆,那是重构级别的工作量。现在只有 3 个的时候做,一下午的事。
三、评估任何智能体系统,把 " 任务完成率 " 拆成三个指标看。
别再只看一个总数。要看:
执行成功率——跑完了没报错(这是大家在报的那个数)
结果正确率——跑完的结果是不是对的(需要抽样人工复核)
一次通过率——不需要人工返工的比例(这个决定它到底帮你省没省事)
第三个指标最重要,也最少有人统计。一个任务如果每次都能 " 完成 ",但每次人都要改一遍才能用,那它的真实价值是负的——因为审阅和修改别人的东西,往往比自己重做还累。
本文数据来源:蚂蚁集团 2026-08-07 开源公告,ITBEAR / 搜狐 IT / TechWeb 2026-08-07 报道,华西证券计算机团队 0807 研报转述。文中 "12 个核心业务板块 "" 任务完成率稳定超过 90%"" 截至 2026-07-31" 均为官方披露原始数据。关于任务完成率统计口径的分析、以及对多智能体路线选择原因的判断,为个人观点,非官方说法。
你们公司现在跑着几个智能体?有没有做过统一的身份和权限管理?评论区说说你踩过的坑。


登录后才可以发布评论哦
打开小程序可以发布评论哦