阿里发布Qwen-UI-Agent:让AI真正“会用”每一块屏幕,手机电脑操作全面超越GPT与Claude

8.20 阿里巴巴正式推出Qwen-UI-Agent——一个以真实世界为中心的GUI智能体基座模型,全面覆盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。该模型在多项核心基准测试中全面对标乃至超越GPT-5.6 Sol、Claude Opus 4.8等业界旗舰模型,让AI真正成为能看懂屏幕、会操作软件的“数字执行器”。

8月20日,阿里巴巴正式推出Qwen-UI-Agent——一个以真实世界为中心的GUI智能体基座模型,全面覆盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。该模型在多项核心基准测试中全面对标乃至超越GPT-5.6 Sol、Claude Opus 4.8等业界旗舰模型,让AI真正成为能看懂屏幕、会操作软件的“数字执行器”。

真机驱动的训练体系:从模拟到现实的跨越

与绝大多数在仿真环境中训练的GUI智能体不同,Qwen-UI-Agent搭建了覆盖100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测。

团队自建了MobileWorld-Real真机基准(400多项任务、100多款应用),彻底打通了“从模拟到真实”的最后一公里。MobileWorld本身是阿里联合多家机构在ACL 2026发布的移动智能体基准,其任务平均步骤达27.8步,多应用任务占比62.2%,难度远超此前的AndroidWorld。

性能领跑:移动端、电脑端、浏览器全面超越

在多项权威基准测试中,Qwen-UI-Agent以单一模型刷新了多个榜单的SOTA记录:

评测基准Qwen-UI-Agent对比成绩
移动端 MobileWorld82.1%领先 GPT-5.6 Sol 12%、Claude Opus 4.8 14.6%、Seed 2.1 Pro 8.9%
移动端 MobileWorld-Real(真机)92.2%超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro
移动端 AndroidDaily97.5%接近满分
电脑端 OSWorld-Verified79.5%超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro
电脑端 OSWorld-v2 Partial40.0%相比基线节省 58% 执行步数
浏览器 WebArena73.6%所有对比模型排名第一
GUI定位 ScreenSpot-Pro81.5%其余4个grounding基准全部刷新SOTA

2026-08-21_110421_470

值得一提的是,Qwen-UI-Agent在通用和Agentic能力上全面保持或超越了训练基座模型,大幅领先GUI专用模型,能够从容应对真实世界中的长尾需求。

混合操作与批量执行:像人一样高效“干活”

Qwen-UI-Agent不仅支持标准的GUI点击操作,还能直接执行命令行(CLI)操作,并在单次决策中批量输出多个动作。

在电脑任务中,CLI动作占比近半,约40%的动作以批量形式输出,大幅缩短了执行轨迹、拓展了能力边界。例如,模型可以跨网站调研产品、核对价格,生成比价方案。

此外,它支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10,000个并发环境同时rollout,结合模型自适应课程学习,持续攻克高难度长程任务。

安全贯穿全程:该停手时就停手

Qwen-UI-Agent将安全判断贯穿任务执行全过程:

  • 危险请求:不执行任何界面操作,直接拒绝并终止任务;

  • 敏感场景:在支付、数据删除、隐私授权等关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。

这种设计让模型既能执行,也懂得何时停手。

真实场景演示:从订咖啡到出差安排

官方展示的多个真实场景中,Qwen-UI-Agent展现了跨应用、跨设备的协同执行能力:

  • 出行规划:在高德搜索地址、打开大众点评找附近1公里内咖啡馆、记下店名、去小红书总结前五条笔记推荐哪款咖啡。

  • 出差安排:查12306最早到杭州西的高铁、算地铁通勤时间、在钉钉安排“出差归来项目同步”会议。

  • 文件整理:在手机相册找到所有收据、移动到远程桌面receipts文件夹、按日期重命名、创建Excel汇总账单。

它依托Harness框架,具备主动服务能力,支持手机、电脑跨设备任务无缝衔接,还可与DeepSearch深度搜索联动,将网页检索与界面操作有机统一。

Qwen-UI-Agent的发布,标志着GUI智能体从“仿真玩具”正式进化为“生产工具”。100多台真机训练、92.2%的真机成功率、97.5%的安卓日常任务完成率——这些数字背后,是AI第一次真正具备了“看懂屏幕、操作软件”的通用能力。其意义在于:大量没有开放API的传统软件,无需改造程序,AI就能像人一样“看着屏幕操作”。当AI能够像人一样使用每一块屏幕时,数字世界的自动化边界将被彻底重新定义。

有关链接如下:

技术报告:https://arxiv.org/abs/2607.28227

项目主页:https://tongyi-mai.github.io/Qwen-UI-Agent

GitHub:https://github.com/Tongyi-MAI/MAI-UI