智东西 8 月 20 日报道,今天,阿里巴巴推出了一款面向数字设备执行的 GUI 智能体基座模型——Qwen-UI-Agent。这一模型主要面向移动端、电脑端、网页端和深度搜索等环境,可以通过虚拟点击、CLI 执行等方式操作设备,并完成复杂任务。
在项目主页显示的 6 个核心 GUI 基准测试中,Qwen-UI-Agent 在其中 5 个里取得了第一,得分要高于 GPT-5.6 Sol、Claude Opus 4.8 等模型,也优于字节今年 6 月发布 Seed 2.1 Pro。值得一提的是,这一模型的主力版本参数量仅为 27B,基于 Qwen 3.5 系列基础模型打造。
阿里展示了多个 Qwen-UI-Agent 的应用场景。用户可以要求模型在手机上通过模拟点击的方式打开地图,查找附近的咖啡馆,并到社交媒体平台搜索关于咖啡馆的评价,辅助用户决策。
在 PC 上执行任务时,Qwen-UI-Agent 则会执行更多 CLI 动作,并在单次决策中批量输出多个动作,完成跨网站调研产品、核对价格,生成比价方案等类型的任务。
在深度搜索场景,这一模型的 GUI 能力和 CLI 能力可以协同完成任务,GUI 负责网页检索与数据源定位,CLI 负责数据下载与分析。
此外,这一模型还可以被用于手机电脑跨端执行、PPT 报告生成等任务,也可以主动关注设备上的消息通知等信息,并给用户提供推荐、方案等。
阿里同步发布了 Qwen-UI-Agent 模型的技术报告和项目主页。技术报告中,阿里透露为了训练这一模型,他们搭建了覆盖100+ 台真实手机、150+ 应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,除了 27B 版本之外,这一模型还提供了 35B-A3B、4B 参数量的版本。他们相信,GUI 智能体有望成为现有数字设备上的通用执行器。
https://arxiv.org/abs/2607.28227
https://tongyi-mai.github.io/Qwen-UI-Agent
https://github.com/Tongyi-MAI/MAI-UI
一、GUI 智能体存在 sim-to-real gap,中国应用独特生态带来额外挑战
GUI 智能体的理想情况是,只要有界面,它就能像人一样看懂、点击、输入,替你完成复杂任务。但阿里团队发现,当前绝大多数 GUI 智能体都困在模拟器里:它们在干净的沙盒环境中刷分漂亮,一旦放到真实手机上,面对变化的界面、弹窗广告、登录过期、网络抖动,性能就会下跌。
这种 " 模拟环境到真实环境 " 的鸿沟(sim-to-real gap)在国内移动生态尤为严重,因为中国市场的超级应用功能深、入口杂、弹窗多,是实验室环境根本复现不了的。
与此同时,真实用户的需求早已不局限于在单个 App 里点几下。一个完整的办公或生活工作流,往往需要在手机、电脑、浏览器之间来回跳转,甚至要求智能体主动感知,比如看到航班取消通知后,自动检索替代方案、检查日程冲突、生成恢复计划。
现有智能体大多是被动问答模式,等用户发指令才动,既不会跨端协作,也缺乏长程任务的规划与纠错能力。
更底层的问题是训练效率。传统 GUI 模型的数据收集高度依赖人工:人工写任务、搭环境、标结果、分析失败等等。随着智能体能力边界扩展,这套工作流已难以为继。
阿里认为,下一代 GUI 基座模型必须同时解决三大矛盾:模拟与真实的矛盾、单点能力与完整工作流的矛盾、人工驱动与规模化的矛盾。这正是 Qwen-UI-Agent 立项的出发点。
二、百台真机搭建移动运行时,多轮 RL 提升任务成功率
为了打造 Qwen-UI-Agent,阿里设计了一套从底层环境、动作空间、训练范式到上层 Harness 的框架。
首先是真机训练环境。研究团队搭建了由 100 多台真实手机、150 多款应用组成的真实移动运行时。
这套系统配备了健康感知调度器,能实时监测每台设备的应用状态、账户登录态和网络状况,遇到故障自动切换;还支持虚拟屏幕技术,让单台手机同时运行多个应用会话,把并发 rollout 效率提升约 20 倍。
模型在训练阶段直接接触的就是真实登录态、动态内容和随机弹窗,这在一定程度上缓解了 sim-to-real gap。
其次是统一动作空间。Qwen-UI-Agent 把 GUI 操作、CLI 命令(如 bash 脚本)和 API 调用纳入同一套动作体系。面对表格处理、文件批量操作等结构化任务,模型可以直接写代码执行。
面对需要视觉确认的操作,比如在表格中填写、页面内搜索、地图缩放等等,则切回 GUI 点击。
单次推理中,Qwen-UI-Agent 还能输出批处理动作,一次性完成多个连贯操作,大幅减少交互轮次。
统计上,在 OSWorld 桌面任务中,CLI 动作占比超过 40%,批处理动作占比约 40%。
在训练层面,团队设计了一套 " 智能体驱动的数据飞轮 "。整个流程由 AI 自动合成任务、自动搭建环境、自动验证结果、自动诊断失败并规划下一轮训练数据,人类只负责监督和修正。
训练分三阶段:监督微调(SFT)建立基础能力;Action RL 专门纠正定位错误、重复循环、过早终止等常见动作失误。
Online RL 则在 100 步以上的长程轨迹中优化端到端成功率,同时调度近万个并发环境加速 rollout。比如,模型在 RL 后会主动验证结果、发现错误后修复,而不是直接宣布成功。
最上层是 Harness 层,负责主动服务和跨端协作。它能读取手机通知,主动识别航班取消等事件并生成执行计划。
也能把跨设备任务串成工作流,让手机上的信息流转到电脑端继续处理。
安全性方面,面对违法或高风险请求,Qwen-UI-Agent 会不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。
三、模型参数效率占优,弹窗广告等干扰执行
在覆盖移动端、桌面端、网页端和 GUI 定位的 6 大核心基准测试中,Qwen-UI-Agent 拿下 5 项第一。
这一模型在移动端表现的表现相对出色,在真实设备评测集 MobileWorld-Real 上,它以 92.2% 的成功率大幅领先 GPT-5.6 Sol、Claude Opus 4.8 和字节 Seed 2.1 Pro,在 AndroidDaily 日常任务集上达到 97.5%,接近满分。
桌面端,它在 OSWorld-Verified 上获得 79.5%,仅次于 Claude Opus 4.8。
论文还揭示了几个值得关注的量化结果与行为洞察。
一是模型的参数效率。Qwen-UI-Agent 的 27B 版本超过多个厂商的旗舰模型,而 35B-A3B 版本在 MobileWorld-Real 上仍能达到 87.4%,说明这套训练方法靠真实环境数据让中小模型获得了更强的任务完成率与部署性价比。
二是 RL 训练改变了模型的工作习惯。动作 RL 后,模型不仅成功率提升 7% 以上,推理 token 还减少了 21.3%,同时实际执行步骤增加了 8.4%,说明它变得更果断,少了很多无意义的自我怀疑。
在线 RL 也带来了变化,模型学会了 " 先验证、再交卷 ",在 OSWorld 上包含验证动作的轨迹比例提升了 14.7%," 假成功(自认为完成但实际失败)" 的比例下降了 11.2%。
模型还自发形成了跨模态协作模式,用命令行高效改状态,再切回界面截图确认效果。
这篇论文还分析了基线模型在真实手机上的失败原因。52% 来自真实世界干扰,比如弹窗广告、UI 误读、物理控件滑不准等等,40% 来自执行能力缺陷,比如找不到深层入口、陷入重复点击循环、长程任务遗忘进度。这些发现证明了真机训练的必要性。
结语:GUI 智能体进入真实世界,落地形态仍是关键命题
阿里在技术报告中透露,未来他们还将探索更高效的 GUI 执行,并通过更好的 Harness 优化模型的长程能力。训练方面,更可扩展的高保真合成环境也在探索范围之中,阿里已构建此类环境,但将它们整合到模型训练中的工作未能在技术报告发布前完成。
GUI 智能体给 AI 的应用场景带来了更多想象空间,已成为国内字节、阶跃等 AI 玩家们探索的方向之一。阿里此前也曾发布 MAI-UI 等研究成果,此次新成果发布或许意味着他们将继续在这一方向投入资源。
不过,模型能力只是第一步。Qwen-UI-Agent 未来会以何种形态落地到真实世界的设备之上,是值得关注的关键命题。


登录后才可以发布评论哦
打开小程序可以发布评论哦