现代前沿:AI 领域的 Computer Use Agent(CUA)
过去几年,AI 的进化速度远超所有人的预期。从文本生成、代码编写,到图像和视频创作,大模型正在不断突破能力边界。然而,一个关键问题始终存在:
现实世界中,大多数工作并不是通过 API 完成的,而是在电脑桌面和各种软件界面上完成的。
打开浏览器、填写表单、整理 Excel、处理图片、登录 ERP、发布内容……这些基于图形界面(GUI)的操作,占据了人类工作时间的绝大部分。而如今,一个新的 AI 方向正在试图接管这些工作,它就是——Computer Use Agent(CUA,计算机使用智能体)。
什么是 CUA?
简单来说,CUA 就是让 AI 学会像人类一样使用电脑。
传统 AI 的工作方式是:
用户提出需求 → AI 调用 API → 返回结果
而 CUA 的工作方式则变成:
用户提出需求 → AI 观察电脑屏幕 → 思考下一步 → 操作鼠标键盘 → 完成任务
它不依赖软件是否开放接口,也不需要开发专门的 API。
因为它直接操作电脑。
就像一个坐在电脑前的数字员工。

为什么 CUA 会成为 AI 的下一个热点?
原因很简单。
现实世界中,90% 的办公工作都发生在 GUI(图形界面)上,而不是 API 中。
例如:
-
在 Excel 中整理销售数据;
-
登录 ERP 系统录入客户信息;
-
打开 Photoshop 批量处理图片;
-
在浏览器中发布文章和社交媒体内容;
-
在多个系统之间复制、粘贴和提交数据。
过去,这些工作通常依赖人工完成,或者使用 RPA(机器人流程自动化)进行简单自动化。
但传统 RPA 最大的问题在于:
太脆弱。
页面一改版,流程就失效;按钮位置一变化,就需要重新配置。
而 CUA 的不同之处在于,它不是死记硬背流程,而是真正“看懂”屏幕。
它知道哪里是按钮,哪里是输入框,知道当前页面发生了什么变化,并能够自主调整操作策略。
因此,很多人认为:
CUA = RPA + 大模型 + 视觉理解。
但它的上限,远远高于传统 RPA。
一个标准的 CUA 是如何工作的?
CUA 的运行过程,本质上是一个不断循环的闭环:
屏幕截图
↓
视觉识别(Perception)
↓
LLM 思考与规划(Reasoning)
↓
生成动作(Action)
↓
鼠标键盘执行(Execution)
↓
再次观察屏幕
整个流程与人类操作电脑的方式几乎完全一致。
第一步:感知(Perception)
AI 首先获取当前屏幕截图。
有些系统还会同时读取系统的可访问性树(Accessibility Tree),帮助 AI 理解页面结构。
例如,它会知道:
-
浏览器当前打开的是哪个网页;
-
登录按钮在哪里;
-
哪个输入框处于激活状态;
-
当前任务是否已经完成。
换句话说:
AI 先“看见”世界。
第二步:决策(Reasoning)
随后,大语言模型开始思考:
我现在在哪里?
下一步应该做什么?
如果页面变化了怎么办?
例如,用户说:
“帮我把 Excel 中的客户信息录入 ERP。”
AI 会自动拆解成:
-
打开 Excel;
-
读取第一行数据;
-
切换到 ERP;
-
找到对应输入框;
-
输入内容;
-
点击提交;
-
重复以上流程。
这一阶段,本质上是:
LLM + Agent Planning(任务规划)。
第三步:动作生成(Action)
推理完成后,AI 会生成具体动作。
例如:
{
"action":"mouse_click",
"coordinate":[240,512]
}
或者:
{
"action":"type",
"text":"Hello World"
}
这些动作可能包括:
-
点击(Click)
-
双击(Double Click)
-
输入(Type)
-
拖拽(Drag)
-
滚动(Scroll)
-
快捷键(Shortcut)
此时,AI 已经从“思考”进入“行动”。
第四步:执行(Execution)
最后,底层执行器接管任务。
通过自动化框架,真实地移动鼠标、敲击键盘。
常见实现方式包括:
-
PyAutoGUI
-
Playwright
-
Selenium
-
Windows UI Automation
-
macOS Accessibility API
此时:
鼠标真的会移动。
按钮真的会被点击。
软件真的会被打开。
AI 不再只是告诉你怎么做。
它开始替你做。
CUA 可以应用在哪些场景?
1、无人值守办公
这是目前最热门的方向。
用户只需要一句话:
“把钉钉近三天客户数据同步到 ERP,并发送日报。”
CUA 会自动:
-
打开钉钉;
-
导出数据;
-
登录 ERP;
-
录入信息;
-
生成 Excel;
-
打开邮箱发送。
整个流程无需人工干预。
真正实现:
24 小时数字员工。
2、跨软件复杂协同
传统自动化通常只能处理单一软件。
而 CUA 可以跨越多个应用。
例如:
Excel
↓
读取销售数据
↓
Photoshop
↓
批量生成宣传图
↓
浏览器
↓
打开社交媒体
↓
自动发布内容
它像一个真正的人类员工一样,在不同软件之间切换工作。
3、电商与运营
电商运营每天需要:
-
上传商品;
-
修改价格;
-
下载订单;
-
批量处理图片;
-
发布营销内容;
-
回复客户。
未来可能只需要一句话:
“帮我运营这个店铺。”
AI 将自动完成绝大部分标准化流程。
全球巨头正在布局 CUA
近两年,几乎所有头部 AI 公司都在押注这一方向。
Claude Computer Use
Anthropic 推出的 Computer Use 功能,可以直接观察屏幕,并模拟鼠标键盘操作电脑。
它已经能够:
-
浏览网页;
-
操作桌面软件;
-
填写表单;
-
完成复杂工作流。
被很多开发者视为目前最成熟的 CUA 产品之一。
OpenAI Operator
OpenAI 推出的网页操作 Agent。
它能够:
-
自动浏览网页;
-
搜索信息;
-
预订服务;
-
在线购物;
-
填写各种表单。
这是 OpenAI 从聊天机器人迈向 Agent 的重要尝试。
OSWorld
如果说 Claude 和 Operator 是产品,
那么 OSWorld 更像是:
CUA 领域的“高考题库”。
它构建了真实操作系统环境,用来测试 AI 是否真的能够像人类一样使用电脑。
如今,OSWorld 已经成为研究 Computer Use Agent 的重要评测基准。
CUA,会是 AGI 的必经之路吗?
许多研究者认为:
如果 AI 想真正进入现实世界,它必须同时拥有三种能力:
-
看见世界(Vision)
-
理解世界(Reasoning)
-
改变世界(Action)
而 CUA,恰恰连接了这三者。
过去,AI 会回答问题;
现在,AI 会调用工具;
未来,AI 会打开电脑、使用软件、完成工作。
它不再只是一个聊天窗口。
而正在成为一种新的劳动力。
也许几年后,每个人都会拥有一个属于自己的 Computer Use Agent——
它了解你的工作习惯,帮你处理重复任务,管理信息流,并在后台 24 小时持续工作。
当 AI 学会使用电脑时,
它距离成为真正意义上的数字员工,已经不远了。
更多推荐




所有评论(0)