8月20日,阿里巴巴正式推出Qwen-UI-Agent——一款以真实世界为中心的GUI智能体基座模型。这不是又一个大语言模型,而是一个能真正看懂屏幕、模拟人类操作App与软件的数字设备通用执行器。它全面覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境,让AI从“能回答问题”进化到“能替你操作一切”。
一、为什么需要Qwen-UI-Agent?
当前绝大多数GUI智能体都困在模拟器里。阿里团队发现,它们在干净的沙盒环境中刷分漂亮,一旦放到真实手机上,面对变化的界面、弹窗广告、登录过期、网络抖动,性能就会大幅下跌。这种“模拟环境到真实环境”的鸿沟(sim-to-real gap),在国内移动生态尤为严重——超级应用功能深、入口杂、弹窗多,是实验室环境根本复现不了的。
与此同时,真实用户的需求早已不局限在单个App里点几下。一个完整的办公或生活工作流,往往需要在手机、电脑、浏览器之间来回跳转,甚至要求智能体主动感知——比如看到航班取消通知后,自动检索替代方案、检查日程冲突、生成恢复计划。现有智能体大多是被动问答模式,等用户发指令才动,既不会跨端协作,也缺乏长程任务的规划与纠错能力。
阿里认为,下一代GUI基座模型必须同时解决三大矛盾:模拟与真实的矛盾、单点能力与完整工作流的矛盾、人工驱动与规模化的矛盾。Qwen-UI-Agent正是为了攻克这三大难题而诞生。
二、碾压级性能:多项基准全面超越GPT与Claude
Qwen-UI-Agent在多项核心GUI基准测试中全面对标并超越业界旗舰模型。在项目主页显示的6个核心GUI基准测试中,它在其中5个里取得了第一。更值得注意的是,这一模型的主力版本参数量仅为27B,基于Qwen 3.5系列基础模型打造——用更小的参数实现了更大的能力。
移动端:
MobileWorld:82.1%,分别领先GPT-5.6 Sol达12.0个百分点、领先Claude Opus 4.8达14.6个百分点
MobileWorld-Real(真机基准) :92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol等模型
电脑端:
浏览器与DeepSearch:
GUI Grounding:
综合来看,Qwen-UI-Agent在通用和Agentic能力上全面保持或超越训练基座模型,并在这两类任务上大幅领先GUI专用模型。
三、百台真机“军训”:打通从模拟到真实最后一公里
Qwen-UI-Agent与其他GUI智能体最大的不同在于——它是在真机上训练出来的。
为了攻克从模拟到真实的落地难题,研发团队搭建了覆盖100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测。这套系统配备了健康感知调度器,能实时监测每台设备的应用状态、账户登录等情况。
更关键的是,团队自建了MobileWorld-Real真机基准——涵盖400多项任务、100多款应用。这意味着模型的每一次迭代,都有真实的物理设备在验证,而不是在模拟器里“自嗨”。从模拟到真实,从实验室到用户手中,Qwen-UI-Agent打通了最后一公里。
四、GUI+CLI双栖作战:批量输出,效率倍增
Qwen-UI-Agent不止会点屏幕。
在常规的GUI界面操作之外,它还能直接执行命令行操作(CLI) ,并在单次决策中批量输出多个动作。在电脑任务中,CLI动作占比近半,约40%的动作以批量形式输出。
这意味着什么?比如跨网站调研产品、核对价格、生成比价方案——传统的逐一点击操作可能需要几十步,而Qwen-UI-Agent可以通过CLI批量执行数据抓取和处理,再通过GUI完成界面交互,大幅缩短执行轨迹、拓展能力边界、提升执行效率。
在深度搜索场景中,GUI和CLI能力甚至可以协同作战——GUI负责网页检索与数据源定位,CLI负责数据下载与分析。
五、安全机制:知道什么时候该停手
能力越大,责任越大。Qwen-UI-Agent将安全判断贯穿任务执行全过程:
危险请求不执行,敏感操作不擅自决定——让模型既能执行,也懂得何时停手。这种“安全第一”的设计理念,让企业用户和个人用户都能放心地将设备操作交给AI。
六、超长轨迹在线强化学习:持续攻克长程任务
真实世界的工作流往往需要几十甚至上百步的操作。Qwen-UI-Agent支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境同时rollout,配合模型自适应课程学习,持续攻克长程任务。
这意味着,随着使用时间的增加和数据的积累,Qwen-UI-Agent在复杂长任务上的表现会越来越稳定、越来越聪明。
七、跨端协同与深度搜索:打破设备壁垒
基于Harness框架,Qwen-UI-Agent具备主动服务意识,支持手机与电脑跨设备任务无缝衔接。它可以主动关注设备上的消息通知等信息,并给用户提供推荐、方案。
同时,模型可与深度搜索(DeepSearch)能力深度融合,将网页信息检索与界面操作有机统一。比如,用户可以让模型在手机上通过模拟点击的方式打开地图查找附近的咖啡馆,再到社交媒体平台搜索评价,辅助决策。
更复杂的场景是手机电脑跨端执行——比如在手机相册中找到所有收据,移动到远程桌面上的指定文件夹,按日期重命名,并创建Excel文件汇总账单。Qwen-UI-Agent可以一口气完成从手机到电脑、从文件整理到数据汇总的全流程。
八、多版本选择与开源生态
除了27B主力版本,Qwen-UI-Agent还提供了35B-A3B、4B等不同参数量的版本,满足从云端到端侧的不同部署需求。
目前,项目已在GitHub开源(https://github.com/Tongyi-MAI/MAI-UI),技术报告同步发布在arXiv(https://arxiv.org/abs/2607.28227),项目主页也已上线。
九、从AI工具到智能办公的范式跃迁
在AI工具导航的视角下,Qwen-UI-Agent代表了一个全新的品类——它既不是单纯的AI写作工具(只管生成文字),也不是AI PPT(只管生成幻灯片),而是一个能跨应用、跨设备、跨端执行完整工作流的“通用执行器”。它不需要应用程序开放API,仅凭视觉理解屏幕即可完成操作,真正解决了大量未开放API的传统软件智能化难题。
展望未来,Qwen-UI-Agent有望成为数字设备上的通用执行器。它让AI不再只是一个“会聊天的助手”,而是一个“会干活的同事”——能看懂你的屏幕、操作你的软件、完成你的任务,并且在关键时候知道停手请示。GUI智能体,正在从实验室走向每个人的手机和电脑。
