拆解字节豆包 Agent 栈:UI-TARS、UI-TARS-desktop、verl 三仓撑起的开源 GUI Agent 平台

字节跳动(ByteDance)旗下字节火山引擎(Volcengine)所属的豆包(Doubao)AI 助手,在 2025 到 2026 上半年的开源节奏被外界拆成三个可独立访问的 GitHub 仓库:bytedance/UI-TARSbytedance/UI-TARS-desktopverl-project/verl。三者分别在「native GUI 模型」、「多模态 Agent 桌面框架(MCP 集成)」「强化学习后训练框架」三个互不重叠的位置上承接豆包的多模态 Agent 平台,与 Doubao-1.5-pro 等闭源模型形成「闭源模型 + 开源 Agent 基础设施」的双轨策略。本文基于 GitHub API 实测、arXiv:2501.12326 UI-TARS 论文与 HN Algolia 三组公开讨论,逐条核对可验证事实。

mermaid diagram

一、官方仓库与论文

bytedance/UI-TARS 在 GitHub API 2026-07-21 实测下为 11,208 stars / 851 forks,仓库描述写明「Pioneering Automated GUI Interaction with Native Agents」,最近一次 push 为 2026-01-27;该仓库的配套论文是 arXiv:2501.12326「UI-TARS: Pioneering Automated GUI Interaction with Native Agents」,HN Algolia 在两次独立帖(2025-01-23 / 2025-04-23)都把同一 arXiv 链接作为讨论起点,是该系列目前的「论文唯一坐标」。该仓库仍是字节跳动内部直接维护的 GUI Agent 模型仓库,而非单独的 Hugging Face 公开权重仓库。

bytedance/UI-TARS-desktop 在 GitHub API 2026-07-21 实测下为 38,158 stars / 3,840 forks,仓库描述为「The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra」,最近一次 push 为 2026-07-01;其 GitHub topics 列表同时给出 gui-agentgui-operatorcomputer-usebrowser-usemcpmcp-servercoworkmultimodalvisiontars 等 14 个标签,把「MCP + Computer Use + Browser Use」三种工具调用模式全部纳入。HN 在 2025-01-22 至 2026-01-08 之间出现 6 条讨论帖(最高 8 points),多次明确把它定位为「Anthropic Computer Use 的开源替代」,与 bytedance/UI-TARS 模型仓库形成上下游关系。

verl-project/verl 在 GitHub API 2026-07-21 实测下为 22,583 stars / 4,247 forks,仓库描述为「verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework」,最近一次 push 为 2026-07-21;HN Algolia 在 2025-02-06 的一条 4-point 帖明确写到「OSS reinforcement learning lib by ByteDance is used to reproduce DeepSeek R1」,把 verl 与同期 DeepSeek R1 的开源训练栈关联起来。该仓库的归属组织为 verl-project(与字节火山引擎官方组织 volcengine 平级但 github.com/volcengine/verl 在本次实测下 302 跳转到 verl-project 主仓),本次正文以仓库真实归属 verl-project/verl 为准。

ByteDance Seed 团队单独维护的 ByteDance-Seed/Seed-Coder(754 stars,最近 push 2025-06-06)与 ByteDance-Seed/Seed-OSS(888 stars,最近 push 2025-09-15)也分别承担「Seed 系列代码模型」「Seed 系列开源模型」的职责,构成豆包模型族之外、ByteDance Seed 实验室的对外开源层面。

二、技术解析:MCP + Computer Use + RL 后训练的三段解耦

豆包 Agent 平台的工程账本可以拆成三段独立能力来看。

第一段是 native GUI 感知bytedance/UI-TARS 仓库以「Pioneering Automated GUI Interaction with Native Agents」自定位,配套 arXiv:2501.12326 把 GUI 交互视为端到端的 native agent 任务而非传统 OCR+script 流水线,模型权重目前以闭源形式接入 ByteDance Seed 与 Volcengine Ark 推理服务(https://www.volcengine.com/product/ark),公开仓库主要承担「模型架构 + 推理 + 评测脚本」等代码层面的开放工作。

第二段是 Agent 框架与 MCP 集成bytedance/UI-TARS-desktop 仓库 topics 列表同时挂出 mcpmcp-servergui-operatorcomputer-usebrowser-usecowork 等标签,是字节跳动对 Anthropic MCP 协议与 Computer Use 范式的直接开源实现;HN Algolia 搜索 UI-TARS bytedance 在 2025-01-23 一条 8-point 帖明确写「ByteDance Releases UI-TARS Desktop, Alternative to Anthropic's Computer Use」,把这条二段工程栈定位成 MCP 时代的开源桌面 Agent 框架。

第三段是 RL 后训练:verl 仓库本身归属 verl-project 而非 volcengine,仓库描述包含「HybridFlow: A Flexible and Efficient RL Post-Training Framework」,与字节火山引擎的模型训练部门(含 Seed 实验室)形成上下游合作关系;HN Algolia 搜索 volcengine verl 在 2025-02-06 一条 4-point 帖把它和 DeepSeek R1 的开源训练栈关联起来,是国产 RL 后训练框架中少数能在 GitHub 拿到过万 stars 的项目(22,583 stars / 4,247 forks 量级)。

mermaid diagram

三、关键点

  • 三仓职责互不重叠但栈型拼接:UI-TARS 仓库聚焦 native GUI 模型(11,208 stars),UI-TARS-desktop 仓库聚焦 MCP + Computer Use 的 Agent 桌面框架(38,158 stars),verl 仓库聚焦 RL 后训练框架(22,583 stars)。三者各自独立 push_at 在近 6 个月内,不存在「一个仓库停摆其他顶上去」的依赖关系。
  • MCP 集成是字节开源 Agent 框架的核心标识:UI-TARS-desktop 仓库 topics 列表 14 个标签中,mcpmcp-servergui-agentgui-operator 同时出现,且 HN 2025-01-23 一条 8-point 帖把它定位为「Anthropic Computer Use 的开源替代」。该仓库 GitHub 默认首页描述把 mcp 写进 tagline,是字节跳动押注 MCP 协议的明确工程信号。
  • RL 后训练框架用 verl 而不是新仓verl-project/verl 22,583 stars 与同期社区主流方案(OpenPipe/ART、cgftinc/benchmax 等数千 stars 量级)相比高出约一个数量级,HN Algolia 2025-02-06 一帖直接把 verl 与 DeepSeek R1 训练栈并提,是国产 RL 后训练框架中少数能稳定持续 push 的项目(最近 push 2026-07-21)。
  • 论文与代码仓解耦:UI-TARS 论文以 arXiv:2501.12326 为唯一公开坐标,代码仓同名 bytedance/UI-TARS,HN 两条独立帖(2025-01-23 / 2025-04-23)都把它作为讨论起点;这种「一个论文 + 一个命名空间 + 一个仓库」的命名约定,降低了读者跨论文 / 代码 / 评测追踪的成本。
  • 豆包 Doubao 闭源 + Seed / Volcengine 开源的双轨策略:豆包主对话产品(Doubao-1.5-pro 等)以闭源模型形式通过 Volcengine Ark 推理服务提供,与 bytedance/UI-TARS / bytedance/UI-TARS-desktop / verl-project/verl 三仓的开源路线并不冲突。HN Algolia 2025-01-24 一条 4-point 帖标题写到「ByteDance Doubao-1.5-pro matches GPT 4o benchmarks at 50x cheaper」(指向 Twitter,需要 2nd-Party 验证),是豆包闭源模型对照 GPT 4o 的少数公开节点;本文不挂具体数字,仅作背景索引。
  • 发布渠道分层:UI-TARS 论文走 arXiv,仓库走 GitHub,社区讨论走 HN Algolia,模型分发走 Volcengine Ark;与 Qwen3-Max 系列走「arXiv + blog + HN + ModelScope」四层渠道形成对比,豆包 Agent 栈更强调「模型 + 框架 + 训练栈」三角解耦。
  • 持续维护活跃度:三仓最近一次 push 分别为 2026-01-27、2026-07-01、2026-07-21,全部在 2026 年上半年,没有任何一仓处于「archive only」状态;这是豆包 Agent 栈与「开源即弃」项目的关键差异,也是评估国产 Agent 基础设施可持续性的核心信号。

四、行业影响与结语

豆包 Agent 栈把「native GUI 模型 + MCP 工具调用 + RL 后训练」拆成三个独立 GitHub 仓库开源,与 Anthropic 走 Claude Computer Use 单栈、OpenAI 走 Operator + ChatGPT 同源、阿里 Qwen 走 ModelScope 一站分发形成路线分化。这种「三仓解耦」的工程账本,给国产 Agent 基础设施提供了一条相对清晰的工程边界:模型权重可以闭源,工程栈与训练栈可以开源并被社区独立维护、改进、复刻。

评估这类国产 Agent 平台栈时,重点聚焦四个公开信号:模型论文是否在 arXiv 上有独立坐标(UID 是公开社区讨论的起点);Agent 框架是否在 topics 列表中公开标明 MCP / Computer Use 等协议支持;RL 后训练框架是否独立维护且与同组织模型形成训练栈上下游;三个仓的最近 push 是否都在近 6 个月内。任一信号缺失,都说明栈的可持续性不可断言。当评估 Doubao 系列背后的工程诚意时,把这四条公开信号与闭源 API 文档并列参照,能更清晰地辨识哪部分栈的开放深度真的达到工程账本的水位。

参考资料

官方文档

开源项目

社区讨论

对比基准


本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注