Anthropic Computer Use 2026:从 14.9% 到 61.4%,桌面 Agent 这一年的工程化跃迁

桌面 Agent 真正的分水岭,不在模型第一次"看见光标"那天,而在它能在 30 小时内盯着一个浏览器标签页不跑偏的那周。

一、起点:2024 年 10 月那个 14.9%

桌面 Agent 这条线的工程起点,Anthropic 自己把它写在了 2024-10-22 的官方公告里:Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku。那一篇公告第一次把"用鼠标和键盘操控电脑"作为公测能力开放到 Claude API。公告里直接给出了当时 OSWorld 基准的数字:

  • 截图类别(screenshot-only):Claude 3.5 Sonnet **14.9%**,次优系统 **7.8%**
  • 多步类别:Claude 3.5 Sonnet **22.0%**

一年半后看这两个数字,会有点恍惚。14.9% 在 OSWorld 上意味着"平均做 7 步任务只能完成 1 步",离"能进生产"差得远。但 2024 年 10 月,这条路被正式打开了——任何拿到 API Key 的开发者,都可以在 Docker 容器里跑起 `ghcr.io/anthropics/anthropic-quickstarts:computer-use-demo-latest`(Simon Willison 当年实测的入口镜像),让 Claude 真的去移动光标、点击按钮、往表单里填字段。

二、裂变:一年半里桌面 Agent 生态长成什么样

从 2024-10 到 2026-07,GitHub 上围绕"Computer Use + 桌面/浏览器 Agent"长出来的项目数量与规模,比模型本身的进步更值得拆。本节所有 star / fork / pushed_at 数字均为本 session 通过 `api.github.com` 实测。

| 项目 | 定位 | ★(实测) | 语言 | 最近一次 commit |

|---|---|---|---|---|

| OpenHands/OpenHands | 开源 AI-Driven Development 框架,自托管控制台可跑 OpenHands / Claude Code / Codex / Gemini 等任意 ACP 兼容 agent | 82,390 | TypeScript | 2026-07-28 |

| browser-use/browser-use | 把任意网站变成 AI agent 可调用的浏览器接口,GitHub 上"用浏览器做 agent"的标准底座 | 107,097 | Python | 2026-07-27 |

| bytedance/UI-TARS-desktop | 字节开源的多模态 AI Agent 桌面端栈,Show HN 标题直接写 "Alternative to Anthropic's Computer Use" | 38,335 | TypeScript | 2026-07-01 |

| xlang-ai/OSWorld | 计算机使用能力的多模态 Agent 基准(NeurIPS 2024),364 个真实桌面任务 | 3,044 | Python | 2026-07-28 |

| anthropics/anthropic-quickstarts | Anthropic 自家 computer-use-demo Docker 镜像、Chrome 集成等起点代码 | 17,329 | Python | 2026-07-24 |

| anthropics/anthropic-cookbook | 官方 notebook 集合,内含 Computer Use 配套教程 | 50,531 | Jupyter | 2026-07-23 |

| anthropics/anthropic-sdk-python | 官方 Python SDK | 3,779 | Python | 2026-07-24 |

| ComposioHQ/composio | 1000+ 工具集成 / 鉴权 / 沙箱运行时 | 29,416 | TypeScript | 2026-07-28 |

四个数字值得单独拎出来:browser-use 107k★、OpenHands 82k★、anthropic-cookbook 50k★、UI-TARS 38k★。一年半前 Computer Use 还是"API 文档里多了一个 `computer_20241022` 工具",现在已经养活了四个十万 / 准十万星的开源项目——这说明桌面 Agent 确实在变成一类产品,而不只是模型 demo。

三、2025-09-29:Sonnet 4.5 把 OSWorld 拉到 61.4%

OSWorld 这条线过去一年的演化,直接体现在 Introducing Claude Sonnet 4.5 这一篇官方公告里。Anthropic 自己放出来的对照:

  • **OSWorld 基准**(真实桌面任务,含浏览器/Office/文件操作)

- 2025-05 前后 Claude Sonnet 4 当时领先:**42.2%**

- 2025-09-29 Sonnet 4.5 发布时:**61.4%**

- 间隔约 4 个月,+19.2 个百分点

  • **SWE-bench Verified**(真实代码任务基准):Sonnet 4.5 处于 SOTA
  • **长链任务保持时间**:Anthropic 自报"在复杂多步任务上观察超过 30 小时保持焦点"
  • **定价**:与 Sonnet 4 持平,**$3 / $15 每百万 token**(输入/输出)
  • **发布形态**:与 Sonnet 4.5 一同推出的还有 **Claude Agent SDK**(即 Anthropic 内部搭建 Claude Code 的基础),以及 Claude for Chrome 扩展向 Max 用户开放

同篇公告里 Sonnet 4.5 客户引述(Cursor / GitHub Copilot / Hai Security / Thomson Reuters)有具体可量化的数字。值得原文引述:

"Claude Sonnet 4.5 reduced average vulnerability intake time for our Hai security agents by 44% while improving accuracy by 25%"

——Nidhi Aggarwal, Chief Product Officer(Anthropic 客户引述,见官方公告)

注意区分:上面 44% / 25% 是 **Anthropic 客户自报的应用层数据**,与 OSWorld 61.4% 这个**模型层基准**是两件事。引用时要分清,否则会出 §2.1 数字溯源问题。

mermaid diagram

四、工程化三道关:OSWorld 之外还有这些坑

OSWorld 是公开基准,但桌面 Agent 真正进生产时撞到的不是基准分,而是另外三道具体的工程关。

**关 1:坐标定位的精度**。Claude 3.5 Sonnet 第一次把"返回截图坐标系"作为公测能力。Simon Willison 当时在 Initial explorations of Anthropic's new Computer Use capability 里有具体描述:模型接收一张截图,直接返回 `(x, y)` 坐标。这是后续 browser-use / UI-TARS / OpenHands 全部依赖的底层能力——没有坐标返回,就没有可执行的 GUI 自动化。

**关 2:Prompt Injection**。Anthropic 自己在 API 文档与 `computer-use-demo` README 里都加了红色"Caution"框,原话是:

"In some circumstances, Claude will follow commands found in content even if it conflicts with the user's instructions. For example, Claude instructions on webpages or contained in images may override instructions or cause Claude to make mistakes. We suggest taking precautions to isolate Claude from sensitive data and actions to avoid risks related to prompt injection."

这是任何桌面 Agent 部署方都要面对的工程问题:模型读到网页里的隐藏指令就可能改路径。Magnitude(HN 43796003,179 points)做"AI-native test framework for web apps"时,就把 prompt injection 防御当核心 feature 来设计。

**关 3:沙箱与边界**。`computer-use-demo` 镜像默认跑 Ubuntu 22.04 + VNC + noVNC,目的就是把模型关进容器,避免它摸到宿主机。字节 UI-TARS 最近一次 commit (c2ad42e, 2026-07-01) 里专门修了一行:`fix(mcp-http-server): default host to 127.0.0.1, not all interfaces`——这说明社区在 MCP HTTP 服务默认监听 0.0.0.0 这件事上踩过坑,需要主动收紧到 127.0.0.1。

mermaid diagram

五、SDK 侧拐点:Claude Agent SDK 首次外发

2025-09-29 跟 Sonnet 4.5 一同发的 Claude Agent SDK,是这一年的另一个工程拐点。Anthropic 的原话是:

"We're also giving developers the building blocks we use ourselves to make Claude Code. We're calling this the Claude Agent SDK. The infrastructure that powers our frontier products—and allows them to reach their full potential—is now yours to build with."

Anthropic 之前只在内部用 Claude Agent 框架做 Claude Code。把它外发,意味着工程上把"模型 + 工具循环 + 文件系统读写 + 子 agent 调度"这套基础设施下沉给开发者。对桌面 Agent 生态来说,这是从"自己拼 LangGraph / OpenHands / LangChain 调用模型"到"用厂商提供的 agent 框架"的转折点。

六、行业影响:从 demo 到企业的三个变量

桌面 Agent 在 2026 下半年的发展,关键变量已经从"模型能不能看见光标"变成下面三件事:

  • **企业级沙箱标准**:VNC 容器 + 主机边界 + 审计日志这三件套,目前在每个部署方都是手搓。Magnitude 类的"AI-native test framework"会逐渐把沙箱 + 测试一体化。社区推动的 MCP 鉴权元能力规范化(见 HN PEC 等讨论)会给这部分加一层协议级保障
  • **多 agent 协作**:OpenHands 已经在 README 里写明可调度 OpenHands / Claude Code / Codex / Gemini 等 ACP 兼容 agent。Sonnet 4.5 自报的 30 小时焦点持续时间,刚好是"一个桌面任务由一个 agent 通宵跑完"的长度——多 agent 协作会让这个时间从单线变成并行
  • **基准与红队**:OSWorld 之外,WebArena、GAIA、Showdown 等基准也会陆续纳入桌面 Agent 评测。kernel.sh 近期有专门一篇 Evaluating computer use models with Anthropic,说明第三方评测方已经在系统化做这件事

七、结语

2024-10 那篇公告里,Anthropic 把 Computer Use 定义为"experimental, at times cumbersome and error-prone"。18 个月后,OSWorld 数字从 14.9% 翻到 61.4%,围绕它长出了 4 个十万 / 准十万星 GitHub 项目,Sonnet 4.5 第一次把 Claude Agent SDK 外发,Claude for Chrome 也向 Max 用户开放——桌面 Agent 已经从"模型能看见光标"走到"能进生产"的工程化临界点。下一步的真正问题,不是模型能不能再快一点,而是沙箱、鉴权、审计、协作这四件事能不能在协议层形成标准。


**参考资料**:

**官方文档**

**开源项目**

**行业报道**

  • (本主题以 Anthropic 官方公告 + GitHub API 元数据 + 第三方评测博客为主,刻意避免编造无源行业报道)

**社区讨论**

**对比基准**


**本文由 AI 生成**。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注