雷锋网 昨天
华尔街实测8款全球主流Agent:千问办公综合排名第一,超Claude Cowork、Codex
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

8 月 19 日消息,华尔街投行杰富瑞分析师近日对八款全球主流 AI Agent 进行了真实办公任务实测,结果显示,通过模型和 Harness 的协同,阿里千问办公综合得分排名第一,超过美国的 Claude Cowork 和 Codex 等 Agent 工具。

此次测试共设置 5 项真实办公任务,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文 PPT,以及基于参考图片生成营销海报。测试结果显示,千问办公整体表现较为均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,是唯一一个在所有测评维度中均获得 90 分以上的 Agent 产品。

 

报告进一步将 Agent 能力拆分为模型与 Harness 两部分进行分析。所谓 Harness,是围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。按照杰富瑞的测算,千问办公的 " 隐含 Harness 分 " 位居此次测试产品首位,高于 Claude Cowork 和 Codex 等七款国内外主流 Agent 产品。这也意味着,在底层模型之外,如何通过工程和产品能力将模型智能稳定转化为实际任务结果,正在成为 Agent 竞争的重要维度。

除任务表现外,成本也正成为 Agent 商业化需要考虑的重要因素。报告显示,千问办公底层 Qwen 3.8 Max 的 API 价格明显低于部分海外头部模型。由于 Agent 通常需要进行多轮推理、持续调用工具和执行长链路任务,企业未来衡量 Agent 价值时,除了模型和产品能力,也可能进一步关注 "Cost per Task",即完成一项真实任务所需的执行成本。阿里 Qwen 模型和千问办公 Agent 的组合体现出较好的性能与成本优势。

过去几个月,Agent 的竞争正在从个人办公转向企业级场景。报告认为,对于企业级 Agent 而言,工作流和生态协同是核心竞争壁垒。随着 Agent 持续连接企业数据、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、Skills 和自动化流程会逐渐沉淀在产品中,形成更高的使用粘性和迁移成本。

据介绍," 千问办公 " 不仅可以帮助个人提效,为企业的 AI 需求设计,也是 " 千问办公 " 的鲜明特色。目前 " 千问办公 " 已初步打通钉钉 IM 工具,企业员工通过 " 千问办公 ",即可完成群聊总结、文档表格创建、消息邮件收发等操作。未来,企业客户还可以将 " 千问办公 " 接入到真实繁杂的工作流中,全面连接企业真实的数据库和工作流,帮助企业提升办公与组织效率。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里 华尔街 杰富瑞 美国 自动化
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论