全天候科技 1小时前
Harness决定AI Agent表现关键!华尔街实测千问办公和Workbuddy
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

华尔街投行杰富瑞的分析师,最近给市面上八个主流中美 AI Agent 做了一场实测,看谁真正能把活干好。

结果有点出乎意料:拿了第一名的,是阿里的千问办公,尽管它背后的模型智能分只排到第四;模型能力第一的 Claude Opus 5,它的 Agent 产品 Claude Cowork 拿了第二;另一个反直觉的结果是,最近大火的 Workbuddy,这轮测试中隐含的 Harness 分在中国 Agent 里反而垫底。

杰富瑞的核心结论,用一句话概括:决定一个 AI Agent 好不好用,往往不是背后那个模型,Harness 做得好是可以弥补模型智能差距的。

Harness 是什么:Agent 里除了模型,剩下的都是它

一个 AI Agent 干活的流程,可以拆成两半:一半是模型,负责 " 想 ";另一半是 harness,负责 " 管 "。

杰富瑞把 harness 拆成了六层,每一层管的都是模型自己管不了的事:

指令:告诉 Agent 这个活是什么,红线在哪

上下文:Agent 干活时能看到的背景信息

工具:Agent 能用什么去完成这个任务

边界:Agent 能行动的范围划在哪

反馈:告诉 Agent 哪里做错了,让它自己纠正、重新规划

治理:让组织能管住一整批 Agent

这六层,正好对应了雇一个员工之后,公司要做的那些事——交代任务、给信息、给工具、划权限、给反馈、做管理。模型就是那个新来的聪明人,harness 就是这套管理机制。聪明人再厉害,扔进一个没有管理的公司,也干不好活。

来看一组控制变量的证据——模型不动,只换 harness,看 Agent 表现怎么变。

结果:同一个 Claude Opus 4.6,套上不同的 harness,在 Terminal-Bench 2.0 这个基准上,得分从 58.0% 一路到 76.4%,最高最低差了 18.4 个百分点。Gemini 3 Pro 同样只换 harness,得分从 56.0% 到 69.4%,差 13.4 个百分点。

实测八个中美 Agent

这次实测,杰富瑞挑了八个中美 Agent。美国三个:Anthropic 的 Claude Cowork、OpenAI 的 Codex、谷歌的 Gemini Spark。中国五个:腾讯的 Workbuddy、阿里的千问办公、字节的豆包、月之暗面的 Kimi Work、MiniMax 的 Code。

考卷是五项任务,每一项对应企业里真实存在的一类活。

第一项,多文件检索。丢给 Agent 一堆文件,让它写一份金蝶软件 2025 年报的一页摘要,覆盖营收、增长、毛利率、净利润、2026 年指引、AI 进展。要求很严:每条事实必须标明来自哪个文件;不同文件数字打架,必须指出冲突、说明哪个更可信;不许悄悄把矛盾数字抹平。

第二项,自主联网研究。让它上网比较微软、Meta、谷歌三家最近季度的营收增速,以及 2026 年的资本开支指引。必须用一手来源,产出一张表,还要明确区分哪些是官方报的数字,哪些是自己估算的。

第三项,控制浏览器。让它用真实的桌面浏览器,从 OpenAI 官网一路点到新闻页,找出最新一篇文章,读完全文,生成一个 Word 文件,含标题、日期、分类、链接、150 到 200 字摘要和三条要点。不许用 API 或爬虫抄近路,必须真的用浏览器点进去。

第四项,做 PPT。给它一份文件,做 5 页英文 PPT,要有故事线,第一页要用文件数据画图,不许编造数据。

第五项,生成营销海报。给它一张鞋的照片做参考,为虚构篮球鞋品牌做原创海报,去掉所有 Nike、Jordan 的 logo,不抄商标口号,3:4 竖版,适合发小红书。

这五项,从读文件、查资料、操作软件、做 PPT 到作图,几乎覆盖了企业里最常见的几类工作。

打分方式也讲究。每项任务拆成 5 个维度,维度跟着任务走,不是通用模板,每个维度 0 到 20 分,一项满分 100,五项平均得出总分。

结果:模型最弱的,拿了第一

前三名分别是:千问办公 95 分,Claude Cowork 94 分,Codex 92 分。接下来依次是 Kimi Work 86 分,豆包 77 分、MiniMax Code 71 分,Workbuddy 和谷歌的 Gemini Spark 并列垫底,都是 66 分。

值得一提的是千问办公的 " 逆袭 "。它背后的模型 Qwen 3.8 Max,智能分只有 56。而 Claude Cowork 背后是 Claude Opus 5,61 分;Codex 背后是 GPT-5.6 Sol,59 分。模型差着五六分,Agent 总分反而高出一两分。

这也说明,Harness 优势,足以抵消模型智能的差距。

为了验证这一点,杰富瑞做了一个拆解:把 Agent 能力分成模型和 Harness 两块,给模型 60% 权重、Harness 40% 权重,用 Agent 总分反推出每个产品的 " 隐含 Harness 分 "。结果千问办公的 Harness 分最高,超过了美国的 Claude Cowork 和 Codex。

实测还发现了一些中美 Agent 的能力差异。

第五项营销海报,是美国 Agent 的滑铁卢。Claude Cowork 和 Gemini Spark 都在这里翻车,而千问办公和豆包这类中国 Agent 做得更好。

第二项控制浏览器,是中国 Agent 的弱点。Workbuddy 和 MiniMax Code 在这里栽了跟头,美国三家的表现更稳。

速度上也有差异。美国那边,Gemini Spark 最快,Codex 次之,Claude Cowork 最慢。中国这边,Workbuddy 最快,豆包和 MiniMax 相当,Kimi Work 和千问办公偏慢。另外,Claude Cowork 的 " 品味 " 最好,PPT 排版和配色最讲究,但这个归功于模型能力,跟 Harness 无关。

价格是另一重碾压。千问办公背后的 Qwen 3.8 Max,API 价格每百万 token 约 1.1 美元;GPT-5.6 Sol 是 4.4 美元,Opus 5 是 3.9 美元。

Workbuddy 的错位

报告里另一个值得细看的对象,是腾讯的 Workbuddy。

它的数据很漂亮:6 月月访问量约 2100 万,中国同类 Agent 里排第一。但在这份实测里,Workbuddy 的隐含 Harness 分,在中国 Agent 里垫底。

访问量第一,Harness 垫底,这个错位怎么解释?

杰富瑞给了三个原因。

第一,Workbuddy 深度嵌在腾讯自家的生态里,腾讯文档、IMA、企业微信,入口都在手上。

第二,它走的是模型无关的路线,用户可以在 harness 里随意切换 Kimi K3、DeepSeek V4、GLM 5.2 这些开源模型,用别人的强模型补自己的短板。

第三,腾讯的营销投入很猛。

这三条,跟 Harness 工程做得好不好,没有直接关系。

报告的判断是:短期看,Workbuddy 赢在入口和分发;长期看,2100 万的用户基础会沉淀出海量真实使用数据,这些数据反过来能帮腾讯改进 Harness,甚至训练自己的模型。

在中国市场这个阶段,分发能力暂时跑在了 Harness 工程前面。但决定一个 Agent 最终能走多远的,还是 Harness。

中国在 Harness 上有优势,也有绕不开的短板

报告把中国和美国的 Harness 打法做了个对比:中国在几个结构性的地方领先,但也有几块短板压着。

先说优势,四个。

超级 App 集成。 美国 Agent 接工具,一般靠 connector 去连。中国不一样,很多 Agent 直接嵌在企微、飞书、钉钉这些平台里,数据、分发、变现一条线全打通。这是中国厂商独有的地基。

模型无关的 Harness。 腾讯 Workbuddy、字节 Trae 走的都是这条路—— harness 自己不带模型,用户按任务的难度、延迟、成本随便切换 Kimi K3、DeepSeek V4、GLM 5.2 这些第三方模型。用别人的强模型,补自己的短板。

低 token 价格。 出口管制逼着中国实验室走高效的 MoE 架构和推理优化,加上国内竞争卷得厉害,中国模型的 token 价格平均比美国低 70% 到 80%。token 便宜,那些消耗大量推理的 agent 工作流才跑得起,这也加快了企业采纳。

迭代速度快。 Hrness 的质量,是靠在真实场景里一次次失败试出来的。中国厂商用户量大、碰到的失败案例多,迭代反而更快。

再说短板,也有四个。

模型差距还在。 Harness-Bench 的数据显示,强模型的平均分更高、跨 Harness 的方差更小;弱模型更依赖 Harness。中国模型整体还落后美国,得靠更出色的 Harness 才能把 Agent 能力顶上去。

产品定价低。 中国企业软件市场一向变现难,中小企业对价格敏感,大型央国企又偏爱定制项目、不太认订阅制。这拖累的不只是利润,还有持续投入 Harness 工程的动力。

出海难。 Workbuddy、Qoder 在国内用户涨得快,但要把这套成功复制到海外很难——中国 Agent 是为本地生态和用户习惯优化的,而美国的 Harness 受益于全球标准化的软件栈。

算力瓶颈。 Agent 工作流对推理算力的消耗,比普通对话高得多。中国厂商高端算力短缺,可能导致服务不稳定,也反过来限制变现能力。

Harness 为什么越来越重要

最后再提一嘴 Harness 的价值,主要是三个方面:

粘性。 模型能力越来越趋同,但 harness 不一样。客户的工作习惯、对话历史、记忆、连接器、技能、自动化,全都沉淀在 harness 里。用得越久,换走的成本越高。模型可以随时换,harness 是换不掉的。

数据飞轮。 每一次 Agent 运行,都会产生一条 trace ——调了什么工具、什么失败了、人怎么纠正的。这些数据能喂给下一代的强化学习,也能用来改进 harness 本身。用户越多,数据越多,Agent 越好,用户更多。这是一个正循环。

付费意愿。 报告点破了一件事:企业和消费者买的不是 " 智能 ",他们自己没有开发应用的能力。他们买的是 "harness + 模型 " 打包好的完整 Agent 产品。这也是为什么 Claude Code、Claude Cowork、Workbuddy 这类产品用户增长快——客户为 harness 付钱,模型只是顺带。

而对于一家公司来说,AI 落地的关键在工程层,不在模型层。真正的机会在 " 把 harness 做好 " 这件事上——管好指令、上下文、工具、边界、反馈、治理这六件事,比追最强的模型更可能做出落地的东西。

本文来自微信公众号AI 原生 Lab,持续拆解真实 AI 落地案例,分享企业 AI 实践与方法论。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 杰富瑞 华尔街 阿里 美国
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论