快科技 8 月 20 日消息,阿里千问大模型正式发布 Qwen-UI-Agent,这是一款面向真实设备的 GUI 图形界面智能体基座模型,覆盖移动端、PC 桌面端、网页以及深度搜索环境。
最大的亮点是让 AI 可以直接看懂屏幕界面、模拟人类操作 App 与软件,充当数字设备通用执行器。
性能评测上该模型多项基准达到业界顶尖水平,移动端 MobileWorld 得分 82.1%,真机基准 MobileWorld-Real 达到 92.2%,AndroidDaily 高达 97.5%。
电脑端 OSWorld?Verified 取得 79.5%,浏览器 WebArena 拿到 73.6%。
ScreenSpot-Pro 界面定位 81.5%,多项榜单刷新 SOTA,综合表现对标并超越 GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro 等海外旗舰模型,同时保留基座模型原本通用与 Agent 能力。
模型基于大规模真机环境训练,搭建超 100 台真实手机、150 余款应用的测试集群,打通从仿真模拟到真实设备落地。
安全机制贯穿全流程,高风险请求直接拒绝,支付、删除数据、权限授权等敏感操作需要用户确认才继续执行。
支持 GUI 图形操作 +CLI 命令行混合动作,支持批量动作输出,电脑任务中接近半数可调用命令行,有效减少执行步骤,提升任务效率。
模型支持超 100 步超长轨迹在线强化学习,上万并发环境用于训练迭代,搭载 AutoResearch 式 AI 驱动数据飞轮,实现任务闭环迭代。
依托 Harness 框架,具备主动服务能力,支持手机、电脑跨设备任务接力,还可以和 DeepSearch 深度搜索联动,把网页检索和界面操作结合。
Qwen-UI-Agent 目标是解决大量没有开放 API 的传统软件应用,不需要改造程序,AI 依靠看懂屏幕就完成操作,拓展智能体落地边界。
【本文结束】如需转载请务必注明出处:快科技
责任编辑:建嘉


登录后才可以发布评论哦
打开小程序可以发布评论哦