2026年8月20日,阿里巴巴通义实验室正式推出Qwen-UI-Agent——一款GUI智能体基座模型。它能在手机、电脑和网页端像真人一样操作界面,完成跨应用的长程任务,支持GUI与命令行混合执行及批量动作输出。与多数在模拟器里“刷分”的智能体不同,Qwen-UI-Agent是在100多台真实手机、150多个真实应用上训练出来的,在MobileWorld、OSWorld、WebArena等八项核心基准测试中全面超越或持平GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro等旗舰模型。
一、为什么需要真机训练?
GUI智能体的核心挑战不是“看得懂屏幕”,而是“在真实设备上稳定完成长链条任务”。绝大多数GUI智能体都困在模拟器里——它们在干净的沙盒环境中刷分漂亮,一旦放到真实手机上,面对变化的界面、弹窗广告、登录过期、网络抖动,性能就会大幅下跌。这种“模拟环境到真实环境”的鸿沟,在国内移动生态尤为严重:超级应用功能深、入口杂、弹窗多,是实验室环境根本复现不了的。
通义实验室搭建了100多台真实手机、150多个应用的真机集群,直接采集真实轨迹用于训练与评测,自建了MobileWorld-Real真机基准(400多项任务、100多款应用),彻底打通了“从模拟到真实”的最后一公里。
二、跨设备统一基座:手机、电脑、浏览器全覆盖
Qwen-UI-Agent是一个跨端统一模型,而非为单一设备训练的分立智能体。它能在手机、电脑与浏览器上自动完成点击、输入、滑动等界面交互,并在ScreenSpot-Pro等界面定位基准上刷新SOTA,精准识别屏幕元素的位置与状态。模型可以跨应用完成“查地图、找餐厅、订座、发日程”这类复杂长链任务,MobileWorld基准得分82.1%,分别领先GPT-5.6 Sol达12.0个百分点、领先Claude Opus 4.8达14.6个百分点;在真机基准MobileWorld-Real上达到92.2%,在AndroidDaily上更是高达97.5%,接近满分。
电脑端方面,在OSWorld-Verified上达到79.5%,超越GPT-5.5、Gemini 3.1 Pro等模型。浏览器与深度搜索方面,在WebArena上达到73.6%,位列所有对比模型第一。
三、GUI+CLI混合执行:效率倍增
Qwen-UI-Agent不止会点屏幕——它还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI动作占比近半,约40%的动作以批量形式输出。整体执行步数节省近58%,让长任务跑得又快又稳。
四、长程在线强化学习:攻克百步以上任务
真实世界的工作流往往需要几十甚至上百步的操作。Qwen-UI-Agent支持在超过100步的超长轨迹上进行端到端在线强化学习训练,配合约10000个并发环境同时rollout,配合模型自适应课程学习,持续攻克高难度长程任务。这是它在MobileWorld、OSWorld、WebArena等八项核心基准上全面领先的关键。
五、分层安全:知道什么时候该停手
能力越大,责任越大。Qwen-UI-Agent将安全判断贯穿任务执行全过程:
违法或高风险请求:在前置分类阶段直接拒绝并终止任务
支付、数据删除、隐私授权等敏感场景:在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续
六、应用场景:从本地生活到跨设备协同
本地生活探店:自动跨地图、点评、社交平台完成地址搜索、人气比对与口碑总结
行程会议联动:查询高铁班次、计算通勤时间,自动创建带提醒的会议日程
深度调研报告:跨网站采集数据、运行分析脚本,自动生成交付物
跨设备发票整理:从手机相册提取发票照片,传到电脑分类归档并生成报销单
航班取消应急:检测到取消通知后自动搜索替代方案,推荐最优选项交还用户决策
在AI工具导航的视角下,Qwen-UI-Agent代表的是“通用执行层”能力。它不同于AI写作工具、AI PPT这类直接产出内容成品的前端应用,而是提供了一种更底层的可能:让AI自己操作软件来完成整套工作。在AI办公软件推荐的逻辑中,这意味着未来的办公自动化不再需要等待每个软件开放接口——只要屏幕上有图形界面,AI就能像人一样使用它。从文件整理到数据收集,从跨系统信息核对到软件操作自动化,这种GUI通用执行能力正在重新定义智能体办公的边界。
七、如何使用
Qwen-UI-Agent以研究预览形式发布,模型代码已开源。开发者可通过GitHub仓库Tongyi-MAI/MAI-UI获取权重与推理代码。环境要求Python 3.10+与PyTorch 2.0+,27B版本需约56GB显存,4B版本单张24GB显卡即可运行。目前技术报告与评测环境免费开放,商业API服务与定价以通义官方公告为准。
