HelloAI
📄 论文精读 🏆 必读经典 · 2024 · Anthropic · 2024-10

Computer Use: Letting Claude See and Operate a Computer

Anthropic (Computer Use Team)
📖 如果你只读一段,读这段
Anthropic 2024-10-22 发布 Computer Use beta——Claude 3.5 Sonnet 第一次能"看屏幕 + 移鼠标 + 敲键盘"。开创 LLM 时代第二阶段:从"调有 API 的工具" → "用 GUI 操作任意软件"。OSWorld benchmark 22% 起步 → 推动 OpenAI Operator / Google Gemini 2.5 Computer Use 跟进。
#Computer Use#GUI Agent#Anthropic#Tool Use#必读

为什么这是里程碑

2024-10-22 Anthropic 发布 Computer Use beta—— 第一个商业可用的”让 LLM 直接操作 GUI 的能力”

意义:

  • LLM 之前的”工具使用” 限制在有 API 的服务
  • Computer Use 打开了所有桌面 / 浏览器软件
  • 触发了行业级竞争:OpenAI Operator(2025-01)、Google Gemini 2.5 Computer Use(2025)跟进

核心创新

1. 统一的”截图 + 动作”接口

tools=[{
  "type": "computer_20241022",
  "name": "computer",
  "display_width_px": 1024,
  "display_height_px": 768,
}]

模型可输出 5 类动作:

  • screenshot:请求截屏(输入)
  • mouse_moveleft_clickright_click:鼠标
  • keytype:键盘
  • cursor_position:当前位置查询

2. 不绑定操作系统 / 应用

模型输出像素坐标而非”按下 X 按钮”。 意味着:

  • Mac / Windows / Linux 都能用同一套
  • 任意软件都能操控(不需要软件做适配)
  • 但代价:精度高度依赖视觉理解 + 屏幕 OCR

3. 闭环:截图 → 推理 → 动作 → 再截图

每步都重新截屏 → 让模型实时”看到”自己动作的后果。 这是比传统 RPA最大的优势——RPA 写死步骤,CUA 自适应。

系统设计

[用户任务:"帮我在 Numbers 里建一个预算表"]

[Claude 推理:先打开 Numbers]
         ↓ action: key Cmd+Space
[执行:打开 Spotlight]
         ↓ screenshot
[Claude 看到 Spotlight 已打开]
         ↓ action: type "Numbers"
... 循环 ...

关键细节

  • 模型每步消耗约 1500 tokens(屏幕截图)
  • 推理 + 动作 + 再截图——每步 1-3 秒
  • 复杂任务可能需要 30-100 步——很慢

OSWorld Benchmark 表现

Anthropic 发布时给出的数字:

ModelOSWorld ScoreWebVoyager Score
Claude Computer Use (2024-10)22%56%
Human baseline~72%~94%

后续追上来的:

ModelOSWorldWebVoyager
OpenAI Operator (2025-01)38.1%87%
Gemini 2.5 Computer Use (2025)~30-40%~80%

演化趋势

  • 9 个月内 OSWorld 从 22% → 38%
  • WebVoyager 已经接近人类水平
  • 桌面任务仍是难点

工程挑战

1. GUI Grounding(视觉定位)

模型从截图识别”哪里是 Submit 按钮”—— 是像素位置任务,不是文本任务。

主流方法:

  • 直接坐标输出(Claude / OpenAI)——模型必须懂”几何”
  • 元素 OCR 标注 + 选编号(some Agents)——更稳但 token 用量大

2. Operational Knowledge

“打开 Numbers → 新建文件 → 选模板…” 这种 procedural knowledge 比识别 UI 更难。 需要:

  • 大量 GUI 操作示范数据
  • 应用 / 工作流的常识

3. 错误恢复

弹窗、加载缓慢、登录过期、CAPTCHA—— 真实环境的 edge case 多到训练时不可能全见过。

4. 安全 / 隔离

Agent 能动你的电脑 = 能干任何坏事

  • 删文件 / 转账 / 发消息 / 不可逆操作

Anthropic 强烈建议:

  • 必须在 VM / Docker / 浏览器沙箱里跑
  • 审计日志:每个动作可追溯
  • 危险操作前 user approval

Use cases / 实战

已经 work

  • 浏览器表单填写
  • 数据系统间搬运
  • 简单 GUI 测试(Selenium 替代)
  • 辅助残障用户操作软件

还有距离

  • 复杂多 app 协作(“找邮件附件 → Excel 加工 → 邮件回复”)
  • 企业级长流程(销售 / HR / 客服全流程)
  • 创作类(用 Photoshop 设计海报)

后续生态发展

Computer Use 是 Anthropic 的”开场” —— 后续:

时间事件
2024-10Claude Computer Use beta
2025-01OpenAI Operator(浏览器优先)
2025-02Google Gemini 2.5 Computer Use
2025-Q3Claude 4 Computer Use 升级
2026多家 Agent 框架(Operator / Claude Code / Devin / Cursor 等都集成 CUA 能力)

它的真实定位

2026 现状评估:

维度评估
技术开创性✅ 第一个
生产可用⚠️ 浏览器场景可用,桌面仍有距离
成本⚠️ 每步 1500 tokens × 50-100 步 = 长任务几美金
安全⚠️ 必须沙箱,否则非常危险
延迟⚠️ 每步几秒——不适合实时场景

最适合:低频但复杂的”手动操作任务自动化”—— 不适合:高频 / 实时 / 高安全要求场景。

推荐配套阅读

💡 一个判断

Computer Use 是 LLM 时代的”shell”

早期电脑:每个程序都得有 GUI 给人用 Shell 时代:脚本能编排所有程序,不需要 GUI LLM 第一阶段:每个工具都得有 API 给 LLM 用 LLM 第二阶段:LLM 用 GUI = 不需要每个工具都暴露 API

Anthropic 是这个范式转换的发起者—— 即使后来 OpenAI / Google 跟进,这条路线的开源 / 协议层心智被 Anthropic 占住。

注意:CUA 还在 0.3 阶段——真正可靠的”AI 自主操作电脑”仍是 2027-2028 的事。

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。