字节跳动(ByteDance)旗下字节火山引擎(Volcengine)所属的豆包(Doubao)AI 助手,在 2025 到 2026 上半年的开源节奏被外界拆成三个可独立访问的 GitHub 仓库:bytedance/UI-TARS、bytedance/UI-TARS-desktop、verl-project/verl。三者分别在「native GUI 模型」、「多模态 Agent 桌面框架(MCP 集成)」「强化学习后训练框架」三个互不重叠的位置上承接豆包的多模态 Agent 平台,与 Doubao-1.5-pro 等闭源模型形成「闭源模型 + 开源 Agent 基础设施」的双轨策略。本文基于 GitHub API 实测、arXiv:2501.12326 UI-TARS 论文与 HN Algolia 三组公开讨论,逐条核对可验证事实。

一、官方仓库与论文
bytedance/UI-TARS 在 GitHub API 2026-07-21 实测下为 11,208 stars / 851 forks,仓库描述写明「Pioneering Automated GUI Interaction with Native Agents」,最近一次 push 为 2026-01-27;该仓库的配套论文是 arXiv:2501.12326「UI-TARS: Pioneering Automated GUI Interaction with Native Agents」,HN Algolia 在两次独立帖(2025-01-23 / 2025-04-23)都把同一 arXiv 链接作为讨论起点,是该系列目前的「论文唯一坐标」。该仓库仍是字节跳动内部直接维护的 GUI Agent 模型仓库,而非单独的 Hugging Face 公开权重仓库。
bytedance/UI-TARS-desktop 在 GitHub API 2026-07-21 实测下为 38,158 stars / 3,840 forks,仓库描述为「The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra」,最近一次 push 为 2026-07-01;其 GitHub topics 列表同时给出 gui-agent、gui-operator、computer-use、browser-use、mcp、mcp-server、cowork、multimodal、vision、tars 等 14 个标签,把「MCP + Computer Use + Browser Use」三种工具调用模式全部纳入。HN 在 2025-01-22 至 2026-01-08 之间出现 6 条讨论帖(最高 8 points),多次明确把它定位为「Anthropic Computer Use 的开源替代」,与 bytedance/UI-TARS 模型仓库形成上下游关系。
verl-project/verl 在 GitHub API 2026-07-21 实测下为 22,583 stars / 4,247 forks,仓库描述为「verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework」,最近一次 push 为 2026-07-21;HN Algolia 在 2025-02-06 的一条 4-point 帖明确写到「OSS reinforcement learning lib by ByteDance is used to reproduce DeepSeek R1」,把 verl 与同期 DeepSeek R1 的开源训练栈关联起来。该仓库的归属组织为 verl-project(与字节火山引擎官方组织 volcengine 平级但 github.com/volcengine/verl 在本次实测下 302 跳转到 verl-project 主仓),本次正文以仓库真实归属 verl-project/verl 为准。
ByteDance Seed 团队单独维护的 ByteDance-Seed/Seed-Coder(754 stars,最近 push 2025-06-06)与 ByteDance-Seed/Seed-OSS(888 stars,最近 push 2025-09-15)也分别承担「Seed 系列代码模型」「Seed 系列开源模型」的职责,构成豆包模型族之外、ByteDance Seed 实验室的对外开源层面。
二、技术解析:MCP + Computer Use + RL 后训练的三段解耦
豆包 Agent 平台的工程账本可以拆成三段独立能力来看。
第一段是 native GUI 感知:bytedance/UI-TARS 仓库以「Pioneering Automated GUI Interaction with Native Agents」自定位,配套 arXiv:2501.12326 把 GUI 交互视为端到端的 native agent 任务而非传统 OCR+script 流水线,模型权重目前以闭源形式接入 ByteDance Seed 与 Volcengine Ark 推理服务(https://www.volcengine.com/product/ark),公开仓库主要承担「模型架构 + 推理 + 评测脚本」等代码层面的开放工作。
第二段是 Agent 框架与 MCP 集成:bytedance/UI-TARS-desktop 仓库 topics 列表同时挂出 mcp、mcp-server、gui-operator、computer-use、browser-use、cowork 等标签,是字节跳动对 Anthropic MCP 协议与 Computer Use 范式的直接开源实现;HN Algolia 搜索 UI-TARS bytedance 在 2025-01-23 一条 8-point 帖明确写「ByteDance Releases UI-TARS Desktop, Alternative to Anthropic's Computer Use」,把这条二段工程栈定位成 MCP 时代的开源桌面 Agent 框架。
第三段是 RL 后训练:verl 仓库本身归属 verl-project 而非 volcengine,仓库描述包含「HybridFlow: A Flexible and Efficient RL Post-Training Framework」,与字节火山引擎的模型训练部门(含 Seed 实验室)形成上下游合作关系;HN Algolia 搜索 volcengine verl 在 2025-02-06 一条 4-point 帖把它和 DeepSeek R1 的开源训练栈关联起来,是国产 RL 后训练框架中少数能在 GitHub 拿到过万 stars 的项目(22,583 stars / 4,247 forks 量级)。

三、关键点
- 三仓职责互不重叠但栈型拼接:UI-TARS 仓库聚焦 native GUI 模型(11,208 stars),UI-TARS-desktop 仓库聚焦 MCP + Computer Use 的 Agent 桌面框架(38,158 stars),verl 仓库聚焦 RL 后训练框架(22,583 stars)。三者各自独立 push_at 在近 6 个月内,不存在「一个仓库停摆其他顶上去」的依赖关系。
- MCP 集成是字节开源 Agent 框架的核心标识:UI-TARS-desktop 仓库 topics 列表 14 个标签中,
mcp、mcp-server、gui-agent、gui-operator同时出现,且 HN 2025-01-23 一条 8-point 帖把它定位为「Anthropic Computer Use 的开源替代」。该仓库 GitHub 默认首页描述把mcp写进 tagline,是字节跳动押注 MCP 协议的明确工程信号。 - RL 后训练框架用 verl 而不是新仓:
verl-project/verl22,583 stars 与同期社区主流方案(OpenPipe/ART、cgftinc/benchmax 等数千 stars 量级)相比高出约一个数量级,HN Algolia 2025-02-06 一帖直接把 verl 与 DeepSeek R1 训练栈并提,是国产 RL 后训练框架中少数能稳定持续 push 的项目(最近 push 2026-07-21)。 - 论文与代码仓解耦:UI-TARS 论文以 arXiv:2501.12326 为唯一公开坐标,代码仓同名
bytedance/UI-TARS,HN 两条独立帖(2025-01-23 / 2025-04-23)都把它作为讨论起点;这种「一个论文 + 一个命名空间 + 一个仓库」的命名约定,降低了读者跨论文 / 代码 / 评测追踪的成本。 - 豆包 Doubao 闭源 + Seed / Volcengine 开源的双轨策略:豆包主对话产品(Doubao-1.5-pro 等)以闭源模型形式通过 Volcengine Ark 推理服务提供,与
bytedance/UI-TARS/bytedance/UI-TARS-desktop/verl-project/verl三仓的开源路线并不冲突。HN Algolia 2025-01-24 一条 4-point 帖标题写到「ByteDance Doubao-1.5-pro matches GPT 4o benchmarks at 50x cheaper」(指向 Twitter,需要 2nd-Party 验证),是豆包闭源模型对照 GPT 4o 的少数公开节点;本文不挂具体数字,仅作背景索引。 - 发布渠道分层:UI-TARS 论文走 arXiv,仓库走 GitHub,社区讨论走 HN Algolia,模型分发走 Volcengine Ark;与 Qwen3-Max 系列走「arXiv + blog + HN + ModelScope」四层渠道形成对比,豆包 Agent 栈更强调「模型 + 框架 + 训练栈」三角解耦。
- 持续维护活跃度:三仓最近一次 push 分别为 2026-01-27、2026-07-01、2026-07-21,全部在 2026 年上半年,没有任何一仓处于「archive only」状态;这是豆包 Agent 栈与「开源即弃」项目的关键差异,也是评估国产 Agent 基础设施可持续性的核心信号。
四、行业影响与结语
豆包 Agent 栈把「native GUI 模型 + MCP 工具调用 + RL 后训练」拆成三个独立 GitHub 仓库开源,与 Anthropic 走 Claude Computer Use 单栈、OpenAI 走 Operator + ChatGPT 同源、阿里 Qwen 走 ModelScope 一站分发形成路线分化。这种「三仓解耦」的工程账本,给国产 Agent 基础设施提供了一条相对清晰的工程边界:模型权重可以闭源,工程栈与训练栈可以开源并被社区独立维护、改进、复刻。
评估这类国产 Agent 平台栈时,重点聚焦四个公开信号:模型论文是否在 arXiv 上有独立坐标(UID 是公开社区讨论的起点);Agent 框架是否在 topics 列表中公开标明 MCP / Computer Use 等协议支持;RL 后训练框架是否独立维护且与同组织模型形成训练栈上下游;三个仓的最近 push 是否都在近 6 个月内。任一信号缺失,都说明栈的可持续性不可断言。当评估 Doubao 系列背后的工程诚意时,把这四条公开信号与闭源 API 文档并列参照,能更清晰地辨识哪部分栈的开放深度真的达到工程账本的水位。
参考资料
官方文档
- UI-TARS Paper (arXiv:2501.12326) [200] - 2025-01-21 native GUI agent 模型论文
开源项目
- bytedance/UI-TARS 仓库元数据 API [200] - 2026-07-21 实测 11,208 stars / 851 forks / pushed 2026-01-27
- bytedance/UI-TARS-desktop 仓库元数据 API [200] - 2026-07-21 实测 38,158 stars / 3,840 forks / pushed 2026-07-01
- bytedance/UI-TARS-desktop README API [200] - 默认首页含 MCP / agent-tars 入口
- verl-project/verl 仓库元数据 API [200] - 2026-07-21 实测 22,583 stars / 4,247 forks / pushed 2026-07-21
- ByteDance-Seed/Seed-Coder 仓库元数据 API [200] - 754 stars / pushed 2025-06-06
- ByteDance-Seed/Seed-OSS 仓库元数据 API [200] - 888 stars / pushed 2025-09-15
社区讨论
- HN Algolia item 42806473: ByteDance Releases UI-TARS Desktop, Alternative to Anthropic's Computer Use [200] - 2025-01-23 8 pts
- HN Algolia item 42802185: UI-Tars Desktop by ByteDance [200] - 2025-01-23 4 pts(agent 栈首次公开讨论)
- HN Algolia item 44876801: UI-Tars-Desktop: Multimodal AI Agent Stack from ByteDance [200] - 2025-08-12 3 pts(话题重新定位为「Agent Stack」)
- HN Algolia item 46540439: ByteDance local agent is something I might feel safe running [200] - 2026-01-08 2 pts(社区对本地化 agent 安全性的讨论)
- HN Algolia item 42965361: OSS reinforcement learning lib by ByteDance used to reproduce DeepSeek R1 [200] - 2025-02-06 4 pts(verl 与 DeepSeek R1 训练栈关联)
- HN Algolia item 42810625: ByteDance Doubao-1.5-pro matches GPT 4o benchmarks at 50x cheaper [200] - 2025-01-24 4 pts(豆包 1.5 Pro 对照 GPT-4o 的少数公开节点,正文不挂具体数字)
- HN Algolia item 48801260: Chinese LLMs Doubao, Qwen to shut down personalized AI agents on July 15 [200] - 2026-07-06 3 pts(豆包 / Qwen 个性化 agent 政策类讨论)
对比基准
- HN Algolia 搜索结果 bytedance UI-Tars Desktop(聚合 5 条独立讨论) [200] - 2025-01 至 2026-01 五条独立讨论(8 / 4 / 3 / 2 / 1 pts)
本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
