过去几年,AI 的进化速度远超所有人的预期。从文本生成、代码编写,到图像和视频创作,大模型正在不断突破能力边界。然而,一个关键问题始终存在:

现实世界中,大多数工作并不是通过 API 完成的,而是在电脑桌面和各种软件界面上完成的。

打开浏览器、填写表单、整理 Excel、处理图片、登录 ERP、发布内容……这些基于图形界面(GUI)的操作,占据了人类工作时间的绝大部分。而如今,一个新的 AI 方向正在试图接管这些工作,它就是——Computer Use Agent(CUA,计算机使用智能体)。


什么是 CUA?

简单来说,CUA 就是让 AI 学会像人类一样使用电脑。

传统 AI 的工作方式是:

用户提出需求 → AI 调用 API → 返回结果

而 CUA 的工作方式则变成:

用户提出需求 → AI 观察电脑屏幕 → 思考下一步 → 操作鼠标键盘 → 完成任务

它不依赖软件是否开放接口,也不需要开发专门的 API。

因为它直接操作电脑。

就像一个坐在电脑前的数字员工。


为什么 CUA 会成为 AI 的下一个热点?

原因很简单。

现实世界中,90% 的办公工作都发生在 GUI(图形界面)上,而不是 API 中。

例如:

  • 在 Excel 中整理销售数据;

  • 登录 ERP 系统录入客户信息;

  • 打开 Photoshop 批量处理图片;

  • 在浏览器中发布文章和社交媒体内容;

  • 在多个系统之间复制、粘贴和提交数据。

过去,这些工作通常依赖人工完成,或者使用 RPA(机器人流程自动化)进行简单自动化。

但传统 RPA 最大的问题在于:

太脆弱。

页面一改版,流程就失效;按钮位置一变化,就需要重新配置。

而 CUA 的不同之处在于,它不是死记硬背流程,而是真正“看懂”屏幕。

它知道哪里是按钮,哪里是输入框,知道当前页面发生了什么变化,并能够自主调整操作策略。

因此,很多人认为:

CUA = RPA + 大模型 + 视觉理解。

但它的上限,远远高于传统 RPA。


一个标准的 CUA 是如何工作的?

CUA 的运行过程,本质上是一个不断循环的闭环:

屏幕截图
    ↓
视觉识别(Perception)
    ↓
LLM 思考与规划(Reasoning)
    ↓
生成动作(Action)
    ↓
鼠标键盘执行(Execution)
    ↓
再次观察屏幕

整个流程与人类操作电脑的方式几乎完全一致。

第一步:感知(Perception)

AI 首先获取当前屏幕截图。

有些系统还会同时读取系统的可访问性树(Accessibility Tree),帮助 AI 理解页面结构。

例如,它会知道:

  • 浏览器当前打开的是哪个网页;

  • 登录按钮在哪里;

  • 哪个输入框处于激活状态;

  • 当前任务是否已经完成。

换句话说:

AI 先“看见”世界。


第二步:决策(Reasoning)

随后,大语言模型开始思考:

我现在在哪里?

下一步应该做什么?

如果页面变化了怎么办?

例如,用户说:

“帮我把 Excel 中的客户信息录入 ERP。”

AI 会自动拆解成:

  1. 打开 Excel;

  2. 读取第一行数据;

  3. 切换到 ERP;

  4. 找到对应输入框;

  5. 输入内容;

  6. 点击提交;

  7. 重复以上流程。

这一阶段,本质上是:

LLM + Agent Planning(任务规划)。


第三步:动作生成(Action)

推理完成后,AI 会生成具体动作。

例如:

{
  "action":"mouse_click",
  "coordinate":[240,512]
}

或者:

{
  "action":"type",
  "text":"Hello World"
}

这些动作可能包括:

  • 点击(Click)

  • 双击(Double Click)

  • 输入(Type)

  • 拖拽(Drag)

  • 滚动(Scroll)

  • 快捷键(Shortcut)

此时,AI 已经从“思考”进入“行动”。


第四步:执行(Execution)

最后,底层执行器接管任务。

通过自动化框架,真实地移动鼠标、敲击键盘。

常见实现方式包括:

  • PyAutoGUI

  • Playwright

  • Selenium

  • Windows UI Automation

  • macOS Accessibility API

此时:

鼠标真的会移动。

按钮真的会被点击。

软件真的会被打开。

AI 不再只是告诉你怎么做。

它开始替你做。


CUA 可以应用在哪些场景?

1、无人值守办公

这是目前最热门的方向。

用户只需要一句话:

“把钉钉近三天客户数据同步到 ERP,并发送日报。”

CUA 会自动:

  • 打开钉钉;

  • 导出数据;

  • 登录 ERP;

  • 录入信息;

  • 生成 Excel;

  • 打开邮箱发送。

整个流程无需人工干预。

真正实现:

24 小时数字员工。


2、跨软件复杂协同

传统自动化通常只能处理单一软件。

而 CUA 可以跨越多个应用。

例如:

Excel
 ↓
读取销售数据
 ↓
Photoshop
 ↓
批量生成宣传图
 ↓
浏览器
 ↓
打开社交媒体
 ↓
自动发布内容

它像一个真正的人类员工一样,在不同软件之间切换工作。


3、电商与运营

电商运营每天需要:

  • 上传商品;

  • 修改价格;

  • 下载订单;

  • 批量处理图片;

  • 发布营销内容;

  • 回复客户。

未来可能只需要一句话:

“帮我运营这个店铺。”

AI 将自动完成绝大部分标准化流程。


全球巨头正在布局 CUA

近两年,几乎所有头部 AI 公司都在押注这一方向。

Claude Computer Use

Anthropic 推出的 Computer Use 功能,可以直接观察屏幕,并模拟鼠标键盘操作电脑。

它已经能够:

  • 浏览网页;

  • 操作桌面软件;

  • 填写表单;

  • 完成复杂工作流。

被很多开发者视为目前最成熟的 CUA 产品之一。


OpenAI Operator

OpenAI 推出的网页操作 Agent。

它能够:

  • 自动浏览网页;

  • 搜索信息;

  • 预订服务;

  • 在线购物;

  • 填写各种表单。

这是 OpenAI 从聊天机器人迈向 Agent 的重要尝试。


OSWorld

如果说 Claude 和 Operator 是产品,

那么 OSWorld 更像是:

CUA 领域的“高考题库”。

它构建了真实操作系统环境,用来测试 AI 是否真的能够像人类一样使用电脑。

如今,OSWorld 已经成为研究 Computer Use Agent 的重要评测基准。


CUA,会是 AGI 的必经之路吗?

许多研究者认为:

如果 AI 想真正进入现实世界,它必须同时拥有三种能力:

  • 看见世界(Vision)

  • 理解世界(Reasoning)

  • 改变世界(Action)

而 CUA,恰恰连接了这三者。

过去,AI 会回答问题;

现在,AI 会调用工具;

未来,AI 会打开电脑、使用软件、完成工作。

它不再只是一个聊天窗口。

而正在成为一种新的劳动力。

也许几年后,每个人都会拥有一个属于自己的 Computer Use Agent——

它了解你的工作习惯,帮你处理重复任务,管理信息流,并在后台 24 小时持续工作。

当 AI 学会使用电脑时,

它距离成为真正意义上的数字员工,已经不远了。

Logo

电商企业物流数字化转型必备!快递鸟 API 接口,72 小时快速完成物流系统集成。全流程实战1V1指导,营造开放的API技术生态圈。

更多推荐