Qwen‑CUA:港大与通义千问联合开源的像素驱动计算机操作智能体

AI新闻 97ai
61

Qwen‑CUA是什么

Qwen‑CUA 是由阿里通义千问团队与港大 xlang‑ai 联合开源的计算机操作智能体(Computer Use Agent),该智能体不依赖系统API、DOM接口,仅通过屏幕截图像素信息理解图形界面,直接输出鼠标、键盘原生操作指令,可对桌面软件、网页应用进行自动化操控。

仓库公开技术报告、Demo代码与实验资源,不提供模型权重文件,配套学术论文arXiv编号:2608.02352。项目分为两大核心组件:Qwen‑CUA多模态推理模型、Agent运行时执行框架。

Qwen-CUA(图1)

功能特色

  1. 纯像素界面理解:只读取屏幕截图,无需软件插件、接口改造,适配Windows、macOS各类第三方软件与网页。

  2. 长时序任务记忆能力:支持最多留存20张历史截图作为视觉上下文,处理多步骤复杂连续任务,缓解长流程上下文丢失。

  3. 安全可控的运行时能力:内置人工审批闸门,高危操作可强制人工确认;完整保存截图、键鼠动作、任务日志,支持任务过程回放复现。

  4. 开箱可用浏览器Demo:基于Playwright实现隔离浏览器会话,提供操作员控制台,可实时查看截图、模型推理文本、动作执行记录。

  5. 双模型规格选择:提供397B‑A17B与Qwen‑CUA‑Max两个版本,兼顾部署门槛与任务性能。

技术细节

1. 视觉上下文分块折叠前缀缓存

传统多模态智能体仅保留少量截图,长任务容易上下文溢出。Qwen‑CUA实现分块折叠前缀缓存技术,可以批量压缩多张历史截图,多轮推理之间复用历史缓存,减少重复计算,提升长轨迹任务稳定性,活跃上下文上限提升至20张截图。

2. 大规模迭代训练体系

训练数据集扩充至4万条可验证任务;依托阿里云ECS搭建近10万vCPU并发集群做并行推演采集训练数据。
训练流程:从固定模型检查点启动监督微调SFT,不持续叠加微调;根据推演结果识别薄弱任务域,更新SFT数据集与RL强化学习任务分布,循环迭代提升模型效果。

3. 模型规格与评测指标

模型版本 OSWorld‑Verified得分 说明
Qwen‑CUA 397B‑A17B 86.2 主流可用版本,综合桌面网页任务
Qwen‑CUA‑Max(超1T参数) 87.6 顶配版本,长时序、科研交互任务表现更强

评测覆盖OSWorld2.0、WebArena、ScienceBoard、Gym‑Anything、RedTeamCUA、MacAgentBench等多套基准,在桌面操作、网页自动化、科研软件交互、对抗安全鲁棒性上取得SOTA结果。

4. Agent运行时模块职责

  • 屏幕捕获:获取界面截图输入模型;

  • 上下文管理:维护视觉缓存、折叠历史上下文;

  • 动作解析校验:解析模型输出,转换为键鼠操作;

  • 安全管控:会话隔离、人工审批钩子;

  • 日志持久化:保存全量任务轨迹用于回放复现。

Qwen-CUA(图2)

应用场景

  1. 桌面软件自动化:跨软件批量处理文档、表格,完成多步骤办公操作,无需编写复杂脚本。

  2. 网页任务自动化:表单填写、信息检索、网页数据采集,适配复杂前端网页。

  3. 科研软件交互:驱动科研工具完成查询、参数配置、结果导出等操作。

  4. 智能体研究实验:计算机智能体算法、长上下文多模态、安全对齐方向的科研复现与二次开发。

  5. 测试自动化:图形界面应用的功能测试,模拟真实用户键鼠操作行为。

重要提示:生产环境务必运行在虚拟机、隔离浏览器环境,禁止直接操作携带敏感账号权限的主机系统。

使用方法

  1. 获取项目源码

git clone https://github.com/xlang-ai/Qwen-CUA
cd Qwen-CUA
  1. 环境依赖安装
    安装项目所需Python依赖,Demo依赖Playwright浏览器引擎,执行Playwright浏览器安装。

  2. 模型端点准备
    项目仓库不携带权重,需要对接兼容OpenAI接口格式的Qwen‑CUA模型推理端点。

  3. 启动Demo控制台
    运行demo目录下启动脚本,开启操作员控制台。控制台可以观察截图、模型思考过程、执行动作,高危操作可开启人工确认。

  4. 执行任务与回放
    输入自然语言任务指令,智能体自动执行;任务结束后,使用保存的日志文件回放完整操作流程。

竞品对比

项目 驱动方式 长视觉上下文 开源情况 安全机制
Qwen‑CUA 屏幕像素截图,不依赖API/DOM 最高20张截图,折叠缓存优化 开源代码,权重不随仓库发布 隔离会话、人工审批、完整日志回放
OpenAI Computer Use 像素截图驱动 有限历史帧,无折叠缓存机制 闭源API服务 沙盒环境,外部不可二次修改
UI‑Tars 部分依赖页面DOM信息辅助推理 少量历史帧上下文 开源 基础日志,缺少强制人工审批流程

Qwen-CUA(图3)

常见问题解答

Qwen‑CUA仓库下载之后为什么不能直接跑?

该GitHub仓库只存放代码Demo、论文文档和资源素材,没有附带模型权重文件,你需要自行部署或者调用外部兼容OpenAI格式的Qwen‑CUA推理接口,才能完整运行智能体。

Qwen‑CUA可以直接在我日常办公电脑执行任务吗?

不建议直接在主力办公主机运行。智能体存在误操作风险,应当部署在虚拟机或者隔离浏览器沙盒内,涉及敏感操作务必开启人工审批,避免误删文件、访问敏感数据。

Qwen‑CUA支持Mac系统吗?

模型评测包含MacAgentBench macOS基准,框架层面支持macOS;本地运行Demo时屏幕捕获、键鼠驱动组件需要适配对应操作系统。

什么是分块折叠前缀缓存,带来什么实际收益?

是上下文优化技术,把多张历史截图做缓存复用,不用每一轮推理全部重算历史图像。实际收益是多步骤长任务不容易遗忘前面操作,减少上下文溢出,推理速度也得到改善。

可以拿Qwen‑CUA做生产业务自动化吗?

代码Demo偏向科研实验用途,没有面向生产的高可用封装;若用于业务,需要自行增加异常捕获、结果校验、权限隔离等工程化改造。

相关链接

总结

Qwen‑CUA作为开源计算机操作智能体实现方案,依靠纯像素视觉理解摆脱了对系统接口的强依赖,借助折叠缓存技术强化长时序多步骤任务处理能力,同时提供可复现的Demo运行框架与安全管控机制,为桌面、网页图形界面自动化以及计算机智能体相关研究提供一套完整可二次开发的开源代码底座。

打赏
THE END
作者头像
97ai
我不是在训练模型,而是在与未来的自己对话。