Computer Use: Letting Claude See and Operate a Computer
为什么这是里程碑
2024-10-22 Anthropic 发布 Computer Use beta—— 第一个商业可用的”让 LLM 直接操作 GUI 的能力”。
意义:
- LLM 之前的”工具使用” 限制在有 API 的服务
- Computer Use 打开了所有桌面 / 浏览器软件
- 触发了行业级竞争:OpenAI Operator(2025-01)、Google Gemini 2.5 Computer Use(2025)跟进
核心创新
1. 统一的”截图 + 动作”接口
tools=[{
"type": "computer_20241022",
"name": "computer",
"display_width_px": 1024,
"display_height_px": 768,
}]
模型可输出 5 类动作:
screenshot:请求截屏(输入)mouse_move、left_click、right_click:鼠标key、type:键盘cursor_position:当前位置查询
2. 不绑定操作系统 / 应用
模型输出像素坐标而非”按下 X 按钮”。 意味着:
- Mac / Windows / Linux 都能用同一套
- 任意软件都能操控(不需要软件做适配)
- 但代价:精度高度依赖视觉理解 + 屏幕 OCR
3. 闭环:截图 → 推理 → 动作 → 再截图
每步都重新截屏 → 让模型实时”看到”自己动作的后果。 这是比传统 RPA最大的优势——RPA 写死步骤,CUA 自适应。
系统设计
[用户任务:"帮我在 Numbers 里建一个预算表"]
↓
[Claude 推理:先打开 Numbers]
↓ action: key Cmd+Space
[执行:打开 Spotlight]
↓ screenshot
[Claude 看到 Spotlight 已打开]
↓ action: type "Numbers"
... 循环 ...
关键细节:
- 模型每步消耗约 1500 tokens(屏幕截图)
- 推理 + 动作 + 再截图——每步 1-3 秒
- 复杂任务可能需要 30-100 步——很慢
OSWorld Benchmark 表现
Anthropic 发布时给出的数字:
| Model | OSWorld Score | WebVoyager Score |
|---|---|---|
| Claude Computer Use (2024-10) | 22% | 56% |
| Human baseline | ~72% | ~94% |
后续追上来的:
| Model | OSWorld | WebVoyager |
|---|---|---|
| OpenAI Operator (2025-01) | 38.1% | 87% |
| Gemini 2.5 Computer Use (2025) | ~30-40% | ~80% |
演化趋势:
- 9 个月内 OSWorld 从 22% → 38%
- WebVoyager 已经接近人类水平
- 桌面任务仍是难点
工程挑战
1. GUI Grounding(视觉定位)
模型从截图识别”哪里是 Submit 按钮”—— 是像素位置任务,不是文本任务。
主流方法:
- 直接坐标输出(Claude / OpenAI)——模型必须懂”几何”
- 元素 OCR 标注 + 选编号(some Agents)——更稳但 token 用量大
2. Operational Knowledge
“打开 Numbers → 新建文件 → 选模板…” 这种 procedural knowledge 比识别 UI 更难。 需要:
- 大量 GUI 操作示范数据
- 应用 / 工作流的常识
3. 错误恢复
弹窗、加载缓慢、登录过期、CAPTCHA—— 真实环境的 edge case 多到训练时不可能全见过。
4. 安全 / 隔离
Agent 能动你的电脑 = 能干任何坏事:
- 删文件 / 转账 / 发消息 / 不可逆操作
Anthropic 强烈建议:
- 必须在 VM / Docker / 浏览器沙箱里跑
- 审计日志:每个动作可追溯
- 危险操作前 user approval
Use cases / 实战
已经 work
- 浏览器表单填写
- 数据系统间搬运
- 简单 GUI 测试(Selenium 替代)
- 辅助残障用户操作软件
还有距离
- 复杂多 app 协作(“找邮件附件 → Excel 加工 → 邮件回复”)
- 企业级长流程(销售 / HR / 客服全流程)
- 创作类(用 Photoshop 设计海报)
后续生态发展
Computer Use 是 Anthropic 的”开场” —— 后续:
| 时间 | 事件 |
|---|---|
| 2024-10 | Claude Computer Use beta |
| 2025-01 | OpenAI Operator(浏览器优先) |
| 2025-02 | Google Gemini 2.5 Computer Use |
| 2025-Q3 | Claude 4 Computer Use 升级 |
| 2026 | 多家 Agent 框架(Operator / Claude Code / Devin / Cursor 等都集成 CUA 能力) |
它的真实定位
2026 现状评估:
| 维度 | 评估 |
|---|---|
| 技术开创性 | ✅ 第一个 |
| 生产可用 | ⚠️ 浏览器场景可用,桌面仍有距离 |
| 成本 | ⚠️ 每步 1500 tokens × 50-100 步 = 长任务几美金 |
| 安全 | ⚠️ 必须沙箱,否则非常危险 |
| 延迟 | ⚠️ 每步几秒——不适合实时场景 |
最适合:低频但复杂的”手动操作任务自动化”—— 不适合:高频 / 实时 / 高安全要求场景。
推荐配套阅读
- HelloAI L4-16 视觉语言 Agent / GUI 操作
- HelloAI L4-04 Agent 构建详解
- HelloAI L4-09 Tool Use 工程实战
- HelloAI 可视化:Computer Use Agent 循环
- Anthropic Computer Use 公告
- Computer Use API 文档
Computer Use 是 LLM 时代的”shell”:
早期电脑:每个程序都得有 GUI 给人用 Shell 时代:脚本能编排所有程序,不需要 GUI LLM 第一阶段:每个工具都得有 API 给 LLM 用 LLM 第二阶段:LLM 用 GUI = 不需要每个工具都暴露 API
Anthropic 是这个范式转换的发起者—— 即使后来 OpenAI / Google 跟进,这条路线的开源 / 协议层心智被 Anthropic 占住。
但注意:CUA 还在 0.3 阶段——真正可靠的”AI 自主操作电脑”仍是 2027-2028 的事。
想要更多论文精读
订阅每周精选 —— 下一篇论文笔记直接送邮箱。
讨论区
· 用 GitHub 账号登录评论src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。