量子位 22小时前
央企做了个通用Agent,直接杀进IDC实测前三!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

起猛了,央企做的企业级通用 Agent,排进了国内前三!

这便是IDC在最新发布的国内首份《中国企业级通用 Agent 产品技术评估》给出的结果:

而这家央企,便是中国电信

并且这次 IDC 没有继续沿用大家熟悉的大模型 Benchmark,而是拿近百道非公开任务,直接考察一款 Agent 在真实办公环境里到底能不能把事情做完。

具体来看,TeleAgent 常规任务得分 3.49 分、复杂任务得分 3.36 分;九项能力中,任务表现拿到 5 分满分,成本效率为此次测评最高分。

而且 TeleAgent 正式上线的时间还不算久,今年 4 月,TeleAgent 桌面端还在公司内部试用。到 7 月,V1.0 才正式对外推出。短短一个多月,如今用户规模已经接近 120 万。

那么问题来了:

一家央企做出来的通用 Agent,为什么能在这一轮竞争里跑得这么快?

近百道题考 Agent,中国电信跑进前三

在深挖 TeleAgent 如何拿下第三名之前,我们且得先需要了解一下 IDC 这次到底考了什么。

以前我们熟知的 Benchmark,更多是倾向于把问题简化成一组分数;数学、代码、推理、知识,一项项跑完以后,就能大致判断模型能力处在哪个位置。

但要考验通用 Agent 的能力,评测的打法就不一样了;毕竟它面对的是公司内部纷繁复杂的业务。

也正因如此,IDC 这次把测试的重点放在了端到端把事情办完上。

按照 IDC 的定义,企业级通用 Agent 需要能够理解目标、调用工具和 Skill、连接企业知识和业务系统,并且持续执行任务。

围绕这个目标,IDC 设计了将近百道非公开任务,既包括邮件、日程、文档处理这类日常办公,也加入了长上下文、多步骤循环、复杂 PPT、表格处理和浏览器操作等复杂任务。

其中有些题目已经很接近真实工作,比如 Agent 要处理 3755 行脏数据,或者从约 3 万字材料中提炼内容,生成 11 页 PPT。

任务跑完还不算结束,IDC 还会继续核验系统状态和最终文件,确认 Agent 是否真的完成了任务。

而从测试结果来看,现在大多数通用 Agent 已经能把复杂任务跑起来,但随着任务变长、步骤变多,交付质量和资源消耗的差距也会随之放大。

也正是在这套考法下,TeleAgent 的任务表现拿到满分,同时又把成本效率做到此次评测最高。

随着任务复杂度、上下文长度和工具调用次数不断增加,各家产品之间的成本和交付差异也同步放大。

这说明通用 Agent 发展到现在,底层模型已经很难解释全部差距;一款 Agent 最后好不好用,越来越取决于模型外围那整套工程系统。

一个 Agent 能否干好活,模型只是一部分

IDC 在这次报告里还专门提到了一个词——Agent Harness。我们可以把它简单理解成围绕大模型搭起来的一整套执行系统。

模型负责理解和推理,但一个复杂任务真正开始运行以后,系统还要安排上下文、调度工具、保存任务状态、控制执行环境。中途一旦出现异常,它还得判断是重试、换路径,还是恢复之前的进度。最后结果生成出来以后,系统还要检查任务到底有没有完成。

这些能力在短任务里不一定明显,可任务一旦拉长,差距就会被迅速放大。TeleAgent 这次拿到的几个高分项,也基本可以从这条工程链路往下拆。

首先是上下文。

Agent 工作时间越长,打开的文件、调用工具返回的结果、前面聊过的内容都会不断塞进上下文。如果系统一直往里堆,Token 很快就会膨胀;可如果压缩得太狠,Agent 又可能把用户一开始交代的要求一起忘掉。

TeleAgent 为此做了一套分级处理。系统会先对价值相对较低的旧工具输出做轻量剪枝,如果上下文依然过长,再由专门的压缩模型对整段内容进行处理。同时,系统还会实时监测上下文是否接近上限,一旦触发窗口限制,就先自动压缩,再继续执行后续任务。目前 TeleAgent 的上下文窗口已经突破 400K。

但仅仅让一次长任务不断线还不够,因为企业办公经常会跨天甚至跨项目。所以 TeleAgent 又加上了autoDream 长期记忆

它会定期整理近期对话,再把新的信息与已有记忆合并。如此一来,项目背景、用户习惯和个人偏好可以跨会话继续保留,用户第二天重新打开时,不需要每次从头解释自己在做什么。

而在更底层,中国电信并没有直接把一个现成的 Coding Agent 框架套进办公场景。

TeleAgent 的核心内核包含约 3 万行自研 Go 代码,团队还专门处理了 Windows PowerShell、麒麟、统信等系统里的兼容性问题。与此同时,产品侧也针对办公任务重新做了适配,因为做 PPT、写报告、处理 Excel,和在代码仓库里找 Bug,本来就是两套截然不同的工作方式。

解决完长任务能不能跑下去,下一件事就变成了这么跑到底贵不贵。这也是企业使用 Agent 时很难绕开的账。

TeleAgent 为此又做了一套ModelRouter

每次请求进来以后,系统会先根据模态、长度、关键词等信息判断任务复杂度,再把任务分配到轻量、均衡和旗舰三档模型。像翻译、总结、格式化这类任务,会优先交给轻量模型;到了 PPT、文档生成和办公自动化,系统会进入均衡档;如果用户要做深度研究、代码调试或者复杂方案,再调动旗舰模型。

这样一来,Agent 不用每处理一个简单任务都调用最重的模型。

从优化的数据来看,这套智能路由可以把推理成本降低约 40%,简单任务响应时间可以控制在 3-5 秒,路由延迟低于 10ms。与此同时,TeleAgent 还在推理侧加入了 PD 分离、KV Cache 和负载感知调度等优化。

这也就不难理解,为什么 TeleAgent 这次在 IDC 的成本效率维度拿到了最高分。

但企业真的要把 Agent 接进内部系统,还得再解决一个问题,也就是安全

当 Agent 只负责生成一段文字时,出错以后最多重新生成一次。可现在的 Agent 开始能够操作文件、调用系统、修改数据,甚至代替员工执行一些业务流程,一次错误操作带来的影响明显更大。

而 TeleAgent 从一开始就把这部分看得比较重。Skill 进入系统以前需要检查来源、病毒和漏洞;短期记忆与长期记忆分别管理;文件读写被限制在指定工作目录;高危命令会被监控,代码和文件操作则尽可能放在隔离环境中完成。

当然,这套思路也直接影响了 TeleAgent 的上线节奏。今年 4 月,桌面端其实已经进入内部试用,但 TeleAgent 随后又花了两个月做安全测试和能力优化,直到 7 月才正式推出。

对于一款追求快速增长的互联网产品来说,这样的节奏可能显得保守;放到央企内部,这反而成了产品必须先过的一道门槛。

也正因如此,TeleAgent 成为首批通过中国信通院相关安全评测的智能体产品之一;在中国电信研究院内部安全评测中,通过率达到 98.2%;与外部安全厂商联合进行的 28 个场景、336 个测试用例里,通过率达到 99.7%。

我们再把这些能力放到一起来看,便不难发现,TeleAgent 这次的几个高分项其实是连起来的:

上下文管理和 Harness 工程决定任务能不能持续往下跑;模型路由和推理优化决定同样一个任务需要花多少钱;安全和权限控制则决定企业敢不敢真的把系统交给 Agent 操作。

而这三件事,恰好也是通用 Agent 从 Demo 走向企业日常办公以后,越来越绕不开的问题。

央企也开始用互联网打法做 AI 产品了

不过有一说一,如果只看今年这轮 Agent 热潮,或许很多人会以为 TeleAgent 也是看到风口以后快速追出来的产品。

但若是我们把时间线再拉长一些,就会不难发现,中国电信对智能体的投入其实已然是有一段时间了。

2024 年底,中国电信已经开始建设星辰智能体平台;2025 年 4 月,这个平台被确定为集团智能体基础设施。到了同年 8 月,团队又推出星辰超级智能体网页版,开始尝试自主式 Agent。此后,随着 Coding Agent 开始从写代码往通用办公延伸,团队又把 Coding 增强、Skill 和桌面环境逐渐接了进来。

等到 2026 年 4 月 TeleAgent 桌面端进入内部试用时,前面已经积累了一年多的平台、技术和产品经验。

而且,TeleAgent 虽然生长在央企内部,做产品的方式却带着很明显的互联网色彩。

中电信人工智能公司目前有 1200 多人,其中九成以上来自社会化招聘,团队里也吸收了不少来自头部互联网公司和 AI 企业的研发人才,整体平均年龄只有 30 岁出头。

在具体的产品团队里,公司又给核心骨干留出了较大的自主招聘和技术探索空间。产品方向尚未完全确定时,团队可以先通过试错把体验做出来;公司内部对早期产品的要求,也没有急着先算收入,而是希望产品先获得用户口碑。

除此之外,其组织方式也跟着发生了一定的变化。过去大型央企内部做一个跨部门产品,很容易陷进多部门、多公司的长协同链条。到了 TeleAgent 这里,团队把资源决策尽量集中起来,让熟悉电信业务的人和有互联网产品经验的人直接在一线配合。

另一方面,中国电信原本的组织体量,又给这支团队提供了互联网创业公司很难拥有的试验环境。

TeleAgent 上线早期,产品先在集团内部大规模使用。中国电信拥有大量员工,内部又分布着办公、网络、政企、云、号卡、宽带等各种业务,这意味着 Agent 每天碰到的都是真实需求,而不是为了演示效果提前设计好的任务。

比如中国电信内部的 Skill 广场,目前已经累计上架 5.6 万个技能,被添加近 200 万次,参与开发和贡献 Skill 的员工也达到 2 万人。

员工自己造出来的东西,也很接地气。有人围绕宽带、号卡这些主营业务制作 Skill,有人用 Agent 生成符合内部格式的 PPT,还有一线员工直接把 Agent 拿去做摄像头巡检和电表识别。原本这些小工具可能需要走立项和开发流程,现在一些需求开始由业务人员自己完成。

这些使用场景反过来又会继续喂给产品团队。因此,中国电信内部既成了 TeleAgent 早期最大的用户池,也成了一个相当复杂的企业 Agent 测试场。产品得同时面对普通员工、专业业务、系统权限和真实数据,这些问题如果在内部都跑不顺,后面面向外部企业就更难谈规模化。

而现在,整个企业市场也正在走到这个阶段。IDC 今年 4 月的调研显示,已经有 48.5% 的企业进入通用 Agent 评估、试点或使用阶段。与此同时,96.9% 的企业 Agent 应用都涉及办公自动化,流程自动化、知识管理和数据分析等场景也排在前列。

到这里,中国电信做 Agent 的特殊性也逐渐显出来了。

它手里原本就有云、算力、安全、政企客户和大量复杂业务场景,现在又开始把互联网公司做产品时常见的快速迭代、用户反馈和成本优化方法吸收进来。

而企业 Agent 接下来要解决的,恰好需要这两套能力同时发挥作用。

总而言之,中国电信这次进入 IDC 发布的评测的前三,其实也是再次印证了一点——

中国电信,已经不是你印象中的运营商;已经是 Full of AI 的那种。

下载地址:

https://www.teleai.com.cn/product/teleagent

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

央企 中国电信
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论