新浪财经 1小时前
大厂AI入口大战升级
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

来源:市场资讯

(来源:钛媒体 APP)

互联网大厂间的 AI 入口大战打到了桌面端。

先说一条刚出炉的消息。据《财经》7 月 21 日报道,阿里即将推出千问办公,把 QoderWork、悟空、MuleRun 三款 Agent 产品合并成,交给钉钉新任 CEO 陈宇森负责。

不止阿里,腾讯也正把资源集中到 WorkBuddy 上,字节内部讨论把飞书和豆包办公深度整合。

信号很明确,持续半年的大厂 Agent" 赛马 " 结束,C 端的入口大战刚歇,各家开始把资源集中到新战场:桌面 Agent 的入口大战升级了。

目前战况如何?数据显示,WorkBuddy 今年 7 月 DAU 已突破 1300 万,是国内用户活跃度最高的 Agent 办公产品。再看一组访问量数据,从六月桌面 AI 原生办公智能体的访问量看,腾讯 WorkBuddy、阿里 QoderWork 排在第一梯队。

四位选手各有来头。

WorkBuddy 产品底座沿用打磨两年多的 CodeBuddy 内核,马化腾在财报会上直接称它是 " 中国使用最广的效率智能体服务 "。

豆包专业版背靠字节自家的 Seedream、Seedance,是四家里多模态弹药比较足的一个,但只跑自家模型、生态也有些封闭。

百度搭子入局较晚但动作密集、持续升级,7 月刚甩出个人版升级、企业版和 " 搭子联盟 " 三个更新。

QoderWork 是阿里把 Agent 能力从代码搬到办公的产物,招牌是带下载量排行的技能市场和 15 套专家套件,即将要升格为 " 千问办公 " 的底座。

一线城市机场和地铁的广告位上,大家都说自己是六边形战士。但用户更多只关心一件事:今天要选一款 Agent,到底谁能真正干活?

这次,我们挑两个高频的真实工作场景,同一台 Mac、同样的提示词、注册即得的免费档,把四家放在到一起对比。

两个真实工作场景,看谁最能干活

两个场景各代表一类办公刚需,一个是重复操作型,考的是手勤不勤;一个是内容生产型,考的是脑子和手艺。

事情不难,但是人工做起来真的很费事,能偷的懒还是偷一偷。

因此,我们需要检查桌面 Agent 能不能自己 " 坐到电脑前 ",把鼠标键盘用起来,从头跑完流程,最后交给我们一份能直接用的本地文件,而不是像问答 AI 只给到一个 " 你可以这样做 " 的方法。

这样一来,权限申请顺不顺、过程看不看得见、耗时稳不稳,也都在观察范围内。

场景一

我们给四位选手同一条提示词:

不得不说,用工具和测工具难的不是任务本身,整个过程很像做实验,环境没理顺,出 bug 总让人心里堵、想放弃。

WorkBuddy 我们前几次就没测成功,细看发现它硬啃反爬、卡在无头浏览器安装上,Agent 直接放弃,任务黄了。

下面的成绩,都是环境理顺之后的正式记录。

WorkBuddy 老老实实地打开了 openai.com/news,最终页面只渲染出 9 条,命令行 curl 又被反爬挡下(403)。但这次它没一条道走到黑,转头找到官方 RSS 订阅源作为 " 最新更新 " 的权威口径,按时间倒序取满 10 条,在桌面生成了两张表:最近 10 条明细 +Agent 中文速览独立页,还自检了一遍链接可用。

全程花了约 4 分钟,但我好像被骗了。任务是 33 分启动、37 分才真正跑完,但界面上的 " 完成时间 " 始终停在 33 分,有一点掩耳盗铃的意味。

测下来,腾讯 WorkBuddy 任务执行先受阻,然后靠 RSS 兜底把活干完。

百度搭子在任务开始前一次性申请权限、显示开始时间,执行时直接跳到默认浏览器,你能亲眼看着它滚动翻页取数,全程约 4 分钟。产出 10 条,但摘要整列是英文、没做中文化,链接也被塞进摘要单元格,没独立成列。

测下来,百度搭子过程相对透明,速度也较快。

豆包的过程就比较偏黑箱,任务开始时不提示开始时间、网页滚动也不显示。最终产出 10 条,中文摘要的信息密度在四家里数一数二(带具体数字),也是唯一把 "Agent 中文速览 " 做进 Excel 独立页的一家。对照官方 RSS 时间序,它抓的这 10 条恰恰贴近字面的 " 最近 "。

测下来,豆包摘要比较扎实,抓得也算准。

QoderWork 选择走软件内置浏览器检索,约 12 分钟,四家里垫底。前期没有人工验证会一直空等;后期「真人验证」反复 5 次以上才过,交互比较磨人。产出结构还算规范,一共有 7 列、中英双标题、带分类与可点链接。比较糟糕的是把一条内容的日期认错成 7-15,连带漏掉了真正 7-15 的新闻。

测下来,QoderWork 结构规范,但慢、手动卡人机验证。

同一句提示,四家抓出的 " 最近 10 条 " 并不重合(✓ = 命中)

有意思的是,这四家抓出的最近 10 条,只有四条对上了。

我们将四份产出并排一放,只有 4 条是四家共有的,其余各不相同。

分析原因发现不是谁抓错了,而在 openai.com/news 本身有两套顺序:默认卡片视图是编辑精选序,RSS 是纯时间倒序。豆包和 WorkBuddy 落在时间序阵营,贴近字面的 " 最近 ";百度搭子和 QoderWork 跟着页面卡片,贴近 " 人打开页面第一眼看到的 "。两边都不算错,但好的 Agent 应该主动告诉你,它用的是哪种口径。

Agent 能力测评,真正拉开差距的,不是谁点得漂亮,而是最后到底有没有把东西交出来。

百度搭子、豆包和 QoderWork 全程真机点击,自己一步步跑完;WorkBuddy 一条路走不通然后就退回 RSS 抄道。

但说到底,桌面 Agent 能不能甩给我们一份打开就能用的文件,比它中间走哪条路重要得多。卡住的时候,肯绕路的往往比硬顶的更管用。

场景二

换个身份代入一下。假设你是个做 AI 的自媒体博主,或者给博主打工的运营。7 月模型圈炸了锅,这波热度必须蹭。Agent 要先摸清楚这个月发生的时间,挑一个有爆款相的选题,一口气把公众号文章、小红书图文、数字人口播视频(还是很有难度的)这三件套全出齐。

这题评的是干活和交付的水准,模型新闻本身真假不核实。四家检索出来的核心事实高度一致,个别对不上的地方在点评里标出来了。

四款提示词一样:

四位选手,一个个上。

WorkBuddy 一上来先建了个任务追踪,把活拆成盘点「选题→三件套→配图」,全程 3 分 16 秒,四家里最快。选题定的是《全球最大开源模型诞生——中国开源联军改写 AI 游戏规则?》钩子还不错,自带开源 vs 闭源的冲突感。

最亮眼的是公众号直接给了能渲染的 HTML 成品,头图压着标题,还甩出金句 " 美国卖铲子,中国发铲子还包邮 ",全文约 900 字,符合字数要求;小红书、口播稿、分镜表一样不落,4 张配图风格还挺统一。唯一没跑完的是数字人成片(本机没渲染引擎),但它老实交代了,还主动给了个替补方案。

测下来,腾讯 WorkBuddy,快,省心,东西拿到手就能用。

百度搭子动手前先正经做了需求分析,交付前还查了字数、精简了两回。它检索的数据在四家里算细的,跑分、定价、股价波动,全都有出处。选题《七月 AI 大乱斗》,冲突和情绪拉满。公众号走的是深度分析路子,还多合成了一段 TTS 口播音频,下载途中代理挂了,它自己用 curl 绕了过去。

不过也做的差的地方,正文 1510 字,比 1500 的硬线多了 10 个字;成品是 .md,不是能直接渲染的 HTML。

测下来,流程一板一眼,检索真的有点实力。

比赛的四家里就豆包一个命中了专门的自媒体写作技能,下笔前先把公众号、小红书、短视频分镜这些平台规范挨个读了一遍,干活的路数也像个老练的新媒体编辑。

细看发现检索面也广,光国产阵营就盘进来 6 家以上。

真正拉开差距的是专业度,公众号约 1400 字,附 4 个备选标题,还逐条核对了来源做内容验真;小红书连置顶评论怎么写、怎么连发矩阵、怎么回评都给了。配图里那张标着真实模型名的阵营对比图,是四家里最贴题的,另外还有数字人形象图和 TTS 语音。交付方式也独一份:所有成品写进一份飞书在线文档,复制就能发。毛病是头图有点文字错乱,思考独白啰嗦了些。

测下来,豆包算是一个学好规矩再动笔的学生。

QoderWork 本次耗时约 10 分钟,属于比较慢的选手。选题 " 轮到闭源巨头睡不着了 ",钩子合格,公众号约 1480 字结构挺整,小红书和口播稿也都有。真正栽跟头在多媒体:配图服务出故障,重试 6 次全败,图片生成失败,音频视频也没影。结尾反问了一句 " 需要我现在重试出图吗 ",已经忘记我们 " 一遍跑通 " 的要求。

测下来,这位选手属于是文字过关,配图有点糟糕。

图为:Agent 耗时相对速度

配图和多媒体,这才是这道题真正拉开距离的地方。

三家成功出图、风格统一、拿来就能用:WorkBuddy 出了 4 张,百度搭子 3 张配图外加一段 TTS 音频,豆包的图相对最对题、数字人形象也做得突出;QoderWork 呢,颗粒无收。

图为:各家生成配图与多媒体成果对比截图

文字这关,四家都不错。真正把高下分出来的,是谁能带着编辑规范和运营策略,把成品直接交到你手上,能做到这步,Agent 才算得上一个靠谱同事。

跑下来最深的一点感受是:东西能不能直接用,远比文字漂不漂亮值钱。飞书文档、能渲染的 HTML,拿到手就能发;换成只丢给你一堆文字加提示词的,乍看挺齐全,真要落地,剩下的活还得你自己干。

多媒体是道硬门槛,出了岔子能兜住才算有实力。任务遇阻卡住了但肯绕条路把活交付,比闷头硬扛强得多,毕竟谁喜欢不能干活给公司憋大雷的同事呢。

价格:这笔账得单独算

实测下来,好消息是大家都给了免费额度,多数情况下跑个一两个任务是够用的。

我原本也是这么打算的,不充值,就当个普通用户,拿免费额度老老实实跑一跑,这样也更贴合大家平时的真实用法。结果谁知道,跑到豆包这儿就提示余额不足了,我只能咬牙充了 68 块把第二个任务跑完……

所以话说回来,真打算重度用之前,还是建议先拿免费档把你天天要干的活跑一遍,看看积分烧得快不快,再决定这钱怎么掏。

谁会终结这场比赛?

两个场景跑完,没有全能冠军,但我们摸清了各位当下擅长什么。

四家广告打得正凶,真正的胜负手根本还没露面。

这场比赛的玩法,也正在悄悄改变。

上半年整个行业烧钱烧出一条教训,Agent 能生成,不等于活能交付。生成一快,复核、判断、担责这些得人来干的环节反倒成了堵点。

有研究说,自主编程 Agent 能把代码提交量拉高 120%,可真正上线的只剩三成。就好比后厨切菜快了三倍,餐厅一天还是卖那么多桌。

所以谁赢,现在下结论太早。对用户来说,想清楚最常干的那件事,拿免费额度把它跑通,再决定掏不掏钱。

我们测的时候,这几款产品几乎是一天一个样,功能天天在变,所以这回只挑了两个场景跑,不敢说测全了。

而且现在有个大趋势,各家 Agent 都在抢入口,Agent 正从电脑桌面往手机上挪。一个方向是手机端和桌面的联动,你人在外面,用手机就能给电脑上的 Agent 派活,回头它在电脑那头默默把事办了。另一个方向更有意思,是往微信这种 IM 里钻,你在微信或者飞书里随手一句话,活就交出去了,连 App 都不用专门打开。

这俩场景眼下都挺热,可惜这次没赶上测,我们留到下一轮再看。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 阿里 腾讯 钛媒体 百度
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论