科创板日报 昨天
中国智能体登顶OSWorld,90.2%成功率反超海外巨头
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

2026 年 7 月 27 日,中国智能体 " 实在 Agent" 以 90.2% 的任务成功率登顶 OSWorld 全球总榜,同时拿下智能体分榜双料冠军。Meta、Anthropic、OpenAI 等硅谷巨头的公开最高纪录,集体被一家中国公司反超。

据了解,这家公司是来自浙江的实在智能。其自研的 " 实在 Agent" 成为 OSWorld 自 2024 年发布以来首个突破 90% 成功率的 Computer-Use Agent。90% 是行业公认的关键临界点——在此之下,智能体还停留在 " 勉强能跑 " 的实验状态;跨过这条线,才意味着迈入稳定可用、可靠落地的产业阶段。

这场暗流之下的角力,终于有了一个清晰的结果。

01 从 " 堆模型 " 到 " 拼工程 ":AI 竞赛的赛道切换

2023 年,所有人都在问 " 哪个模型参数最多 ";2024 年,问题变成 " 哪个模型推理最强 ";到了 2026 年,产业界的追问已经变成—— " 哪个智能体最能干活 "。

OSWorld 的出现,正是为了回答这个问题。

该榜单由香港大学、卡内基梅隆大学、滑铁卢大学等机构于 2024 年发表于人工智能顶会 NeurIPS,是目前全球公认的 Computer-Use Agent 核心评测基准。

与仅支持网页交互或 API 调用的传统基准不同,OSWorld 在真实 Ubuntu 虚拟机中部署了大量应用程序,设置了 361 个实战任务,覆盖办公、编程、UI 设计、系统运维等高频场景。任务是否完成由机器自动判定,无任何人工主观干预。

正因如此,OSWorld 成了全球科技巨头验证智能体能力的 " 必争之地 "。OpenAI 发布 GPT-5.4 时强调 " 首次超越人类 ",Google 发布 Gemini 3.6 Flash 时标注 "83% 全场最高分 ",Anthropic 发布 Claude Sonnet 5 时突出 "81.2%"。

复盘 OSWorld 的迭代曲线,整个行业的进步一目了然:

● 2024 年,最强智能体成功率仅 12.2%

● 2025 年先后攀升至 22.0%、72.6%,首次超越人类操作基线

● 2026 年 5 月推高至 83.6%

●两个月后,实在 Agent 以 90.2% 登顶

两年时间,从 12% 到 90%。但真正值得追问的不是 " 谁跑得更快 ",而是 " 为什么跑得更快 "。拆解实在 Agent 的得分,答案逐渐清晰:

跨应用协同:该任务模拟的是真实办公中最繁琐的跨系统流程,要求智能体在多个软件间连续穿梭。实在 Agent 在 93 个任务中成功率 84.7%,领先第二名近 10 个百分点。

非标界面图像处理:GIMP 界面充满浮动面板和非标准工具栏,堪称视觉识别的 " 噩梦级 " 场景。实在 Agent 在 26 个任务中拿下 24 个,成功率 92.3%。

系统底层操作:24 个任务实现 100% 满分零失误,覆盖进程管理、权限修改、命令行操作。

从跨应用到复杂界面,再到底层系统——这些 " 硬骨头 " 场景拼的不是模型 " 能想多深 ",而是工程 " 能做多稳 "。行业给这种工程能力起了一个名字:Harness,它决定了 AI 能不能把 " 想做的事 " 真正 " 做成 "。

这一判断有扎实的实证支撑。斯坦福大学与清华大学的研究表明,在同一底层模型的前提下,仅因 Harness 设计不同,智能体的表现差距可达 6% 至 17%。在编码基准测试中,同一模型仅改变 Harness 设计,解决率可从约 5% 跃升至 30% 以上。

02 Harness:AI 的操作系统,实在智能的先行者之路

Harness 可以通俗地理解为 AI 的 " 操作系统 " ——就像电脑有了 Windows 才能稳定运行各种软件一样,AI 有了 Harness,才能可靠地完成一系列复杂操作。任务怎么拆、工具怎么调、出错了怎么补救——所有这些让 AI" 不掉链子 " 的机制,都属于 Harness 的范畴。

Harness 并非一个新概念,但它在 2026 年成为 AI 工程领域的核心范式:从 Prompt Engineering 到 Context Engineering,再到 Harness Engineering,行业对 " 如何让模型稳定交付 " 的认知正在完成一次系统性升级。

中信证券在近期研报中指出,Agent 走向长任务执行与多智能体协同后,状态维护、错误传播与 Token 成本加速上升,模型单步能力强并不等于能稳定交付。Harness 是将底层智能转化为稳定交付的中间层,可触达空间由约 2000 亿美元扩展至 1.5 万亿美元。换言之,过去 AI 只能服务有标准接口的企业,而 Harness 让那些‘没有 API ’的老旧系统也能被 AI 接管,企业场景的可触达范围被大幅拓宽

就如同 DeepSeek 除了模型核心技术,工程化能力是其大幅降低成本的关键一样,Harness 对智能体的意义同样如此——它决定了 AI 能不能稳定、可控、低成本地 " 把事办成 "。

在 Harness 这个赛道上,成立于 2018 年的实在智能是先行者。当行业还在追捧纯 API 对接时,公司创始人兼 CEO 孙林君做出了一个在今天看来极具前瞻性的判断。

" 我们做智能体,就围绕第一性原理——你不能干的,我能不能干?谁的能力边界更广,谁的成本更低、效率更高?"

这个判断背后是对企业 IT 环境的深刻理解。孙林君在今年的世界人工智能大会上算过一笔账:像西门子这样的工业系统,开发一个接口费用可能高达 20 万。更不用说那些运行了几十年的内部系统,外面根本看不到接口。而电商平台的 API 策略三天两头微调,哪怕只是一个 3% 概率的 A/B 测试,纯 API 对接的系统就可能当场瘫痪。

" 纯靠 API 对接的产品,后期维护成本高到无法想象,最后大多只能给客户退款。"

所以实在智能做实在 Agent 的逻辑很简单——不站队,不设限。有现成接口的就走接口,高效顺畅;没有接口的,AI 就切换成 " 人肉模式 " ——像真人一样看屏幕、动鼠标、敲键盘,把数据拿回来,把事办成。

用户感知层面,变化是颠覆性的——过去需要 IT 部门花数月开发接口才能连通的系统,现在智能体可以直接 " 看屏幕 " 操作。一位制造业客户曾对孙林君说:" 以前上个新系统要等半年,现在告诉 Agent ‘把上个月的产线数据整理成报表’,十分钟就回来了。"

从用户角度看,Harness 的价值很简单:AI 不再是一个需要你维护的 " 工具 ",而是一个能自己动手干活的 " 同事 "。

03 八年坚守:从 GUI 到 AGI 的终局判断

2025 年底至 2026 年初,Harness 完成从概念到共识的跃迁。但实在智能在这条路上的探索,远早于行业的集体转向。

" 技术圈有一种流行的看法:只有通过 API 和 MCP 对接才是先进的,像人一样看屏幕、点鼠标的 GUI 路线,只是过渡期的‘妥协方案’。" 孙林君直言。

但实在智能从一开始就把 GUI 作为核心能力来建设。" 这不是技术路线的站队问题,而是对 AI 终局的判断问题。"

这个判断的核心逻辑是,AGI 要实现真正的通用智能,一定需要在多模态能力上有所突破——因为只有像人一样感知和操作这个世界,AI 才能真正理解这个世界。

在孙林君看来,AI 的终局不在参数里,而在对真实世界的感知与交互中。" 未来要想实现 AGI,必须先让 AI 认识世界、接触世界、操作世界。" 这里的 " 世界 ",首先就是人类每天都在面对的数字世界——操作系统、软件界面、业务流程。

正是基于这一判断,实在 Agent 在 API 之外深耕 GUI 八年。实在 Agent 通过自研的 ISSUT(智能屏幕语义理解)技术和融合拾取能力,让 AI 能像人一样 " 看懂 " 屏幕上的 UI 界面,在没有数据接口的情况下也能精准获取数据、操作软件。

八年时间,实在 Agent 沉淀下来的是一整套 " 会生长的 "Harness 工程体系——

真实场景的数据飞轮:实在 Agent 已服务超 6000 家企业客户,覆盖制造、电商、能源、跨境、医药、物流运输等核心行业。每一次真实场景的运行,都是一次 Harness 的练兵——异常报错如何处理,流程卡顿如何恢复,边界案例如何兜底。千万级异常场景的迭代优化,让实在 Agent 具备了实验室模型难以企及的 " 实战免疫力 "。

从自动化到 Agent 的工程跃迁:实在智能的八年,恰好也是企业自动化向 AI Agent 演进的关键周期。自动化时代的流程编排、异常处理、系统集成经验,被完整地继承并升级为 Agent 时代的 Harness 能力。这种 " 工程基因 " 的延续,是纯粹的模型公司短期内难以复制的。

" 模型是可插拔的‘大脑’,但光有大脑远远不够。真正决定 AI 能不能‘动手干活’的,是 Harness 工程能力——如何拆解复杂任务、如何调度各类软件工具、如何在执行出错时自我纠错、如何组织多个智能体协同作业。"

实在智能的八年坚守,本质上是对一个判断的反复验证:AI 的终局不在模型参数里,而在工程落地的细节里。

04 国产智能体:从单点突破到产业底座

实在 Agent 登顶 OSWorld,不仅是单个企业的技术突破,更是国产智能体产业的一个标志性事件。

格局正在变化。近期阿里将 QoderWork、悟空与 MuleRun 整合至千问办公,腾讯推动 WorkBuddy 与 QClaw 团队收敛。上述动作形式各异,但本质上均在强化位于模型与用户场景之间的 Harness 层。易观分析发布的《中国办公智能体平台市场研究报告 2026》显示,中国桌面端办公 Agent 月访问量由 2026 年 3 月超 2000 万次增至 6 月超 6000 万次。

国产智能体,正在从 " 追赶者 " 变成 " 定义者 "。

但压力同样存在。在通用大模型基座上,硅谷巨头仍凭借算力与资本优势保持领跑。中国企业要在智能体赛道实现超越,必须在工程化落地、GUI 多模态操控与真实工作流打通上建立不可替代的壁垒。

实在智能的突破,恰恰证明了这条路径的可行性。

从 2018 年成立,到 2023 年推出行业首个智能体,再到 2026 年登顶 OSWorld。实在智能的每一步,都在回答同一个问题:如何让 AI 从 " 能聊天 " 变成 " 能干活 "。而 OSWorld 90.2% 的成绩,是对这个问题最有力的回答。

AI 智能体的竞争不是一家公司对另一家公司的较量,而是整个产业生态的系统工程。中国在智能体工程化落地上的积累,是参与这场全球竞赛的核心筹码,行业需要形成合力、共建生态,才能在下一代 AI 基础设施的定义权上占据主动。

一位人工智能领域资深分析人士向作者表示:" 实在 Agent 登顶 OSWorld 的意义,不只是一次刷榜。它证明了在 Harness 工程这条路上,中国团队有能力定义标准。当 AI 智能体网络成为继电网、互联网之后人类历史上的第三张全球网络,成为所有产业之下的新底座时,谁掌握了 Harness 的工程范式,谁就掌握了下一代企业级软件的定价权。从这个角度看,实在智能的突破,是国产智能体产业的一个起点,而不是终点。"

阅 1.64W+ 特别声明:文章内容仅供参考,不构成投资建议。投资者据此操作风险自担。

评论
大家都在看