OpenAI 在 2025 年 8 月把 gpt-oss-120b 与 gpt-oss-20b 以 Apache 2.0 协议开源,不到 30 天 GitHub Star 突破 2 万。这两个模型最反常的不是参数量,而是 120B 能在 8GB 显存上跑起来——这件事的工程拐点不是某一项突破,而是 MXFP4 量化、tiktoken 词汇表、harmony 响应格式、ollama/vllm/unsloth 端侧栈、Apple Neural Engine 适配这 5 件事在同一时间窗口凑齐。
核心事件
2025 年 8 月 5 日,OpenAI 同步在 GitHub、Hugging Face、arXiv 三个地方发开 gpt-oss-120b / gpt-oss-20b,采用 Apache 2.0 协议(对商用非常友好)。官方 Model Card 论文(arXiv:2508.10925)直接挂在 arXiv 上, 同月 4 月 NVIDIA 在 MXFP4 训练论文(arXiv:2502.20586)里给出 4-bit 浮点量化的工程化方案。Hugging Face 上 gpt-oss-20b 与 120b 两个模型分别累积了数十万次下载, 几乎所有端侧推理项目 (ollama、vllm、llama.cpp、LM Studio) 都在一周内合入支持。
技术解析
gpt-oss 与之前大厂开源端侧模型最大的区别, 是它把 MXFP4 训练原生化——不是训练后量化, 而是在训练阶段就按 4-bit 浮点格式计算梯度。MXFP4 用 e4m3 编码 + block-wise 32 元素共享 scale, 相比 INT4 量化有 16 倍动态范围, 相比 FP8 又少一半显存, 实测在 8GB 显存显卡上 120B 跑得动 (HN Reddit 帖子多人验证)。配套的 tiktoken 仓库 18,854 stars, 是 OpenAI 全套模型共享的 tokenizer。
部署路径选择取决于显存预算: 全量自托管 120B 走 vLLM(87,441 stars)+ H100; 单卡轻量部署 20B 走 vLLM 单 GPU; 8GB 显存走 ollama(177,096 stars)+ MXFP4; 极端省资源走 llama.cpp CPU 量化, 还能塞进 Apple Neural Engine 在 iPhone 17 Pro 上跑。Harmony 响应格式是这次新引入的关键——用 <|channel|> <|start|> <|end|> 这类特殊 token 把推理过程 (analysis) / 工具调用 (commentary) / 最终答案 (final) 三个 channel 隔离开, 让模型既能长链路推理又不污染输出。OpenAI 配套开源了 openai/harmony 仓库专门承载这套协议, HN 上 374 分热度。
关键点
- MXFP4 不是训练后量化: NVIDIA 论文(arXiv:2502.20586)证明 FP4 训练稳定性, gpt-oss 直接原生 FP4, 推理端不需要额外的量化校准数据集
- 8GB 显存跑 120B: 来自社区实测(Reddit r/LocalLLaMA 与 HN 讨论), 不是官方 benchmark 数字, 实际 batch size 1 / context 短 / 速度慢, 但能跑
- Harmony 协议是 OpenAI 自创: 用 special tokens 隔离 reasoning 与 final output, 与 Anthropic 公开的 thinking 协议思路类似但 token 集不通用
- oasis 生态一周内就位: ollama / vllm / unsloth / llama.cpp / LM Studio 在 8 月第二周全部合入支持, 这种生态响应速度在大厂开源历史上罕见
- Apple Neural Engine 适配: 意味着 iPhone 17 Pro / M4 Mac 可以在不联网的情况下本地跑 20B 模型, 这件事对消费级 AI agent 部署是质变
行业影响
gpt-oss 把"端侧可跑 + 商用友好"两个约束同时满足, 等于把 AI Agent 部署成本从"必须连云"压到"一次性部署永久本地"。后续消费级 agent 产品(手机助手、车载、IoT)会直接基于 20B 这个量级做产品化, 而不是用云端 API 拼凑。
部署路径

推理时序

结语
gpt-oss 的真正信号不是"OpenAI 也开源了",而是"120B 跑进 8GB"意味着 AI Agent 的部署形态正在分裂:云端拼吞吐、端侧拼响应时延与离线能力。接下来 12 个月值得聚焦的是国产大厂(阿里 Qwen3、DeepSeek V4、字节豆包 Pro)是否会跟进 MXFP4 原生训练 + harmony 这类自定义 token 协议,以及在车规级芯片上跑 7B 端侧模型的具体落地节奏。
**本文由 AI 生成**。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
参考资料
官方文档
- arXiv: gpt-oss-120b & gpt-oss-20b Model Card - 2025-08
- arXiv: Training LLMs with MXFP4 (NVIDIA) - 2025-02
- arXiv: In harmony with gpt-oss - 2026-04
开源项目
- openai/gpt-oss (GitHub) [200] - 20,266 stars / Apache 2.0 / 推送于 2026-07-24
- openai/openai-python (GitHub) [200] - 31,244 stars / 推送于 2026-07-27
- openai/tiktoken (GitHub) [200] - 18,854 stars / 推送于 2026-05-24
- openai/harmony (GitHub) [200] - HN 374 分 / 专用响应格式仓库
- ollama/ollama (GitHub) [200] - 177,096 stars / 推送于 2026-07-28
- vllm-project/vllm (GitHub) [200] - 87,441 stars / 推送于 2026-07-28
- unslothai/unsloth (GitHub) [200] - 69,012 stars / 推送于 2026-07-28
行业报道
- HN: GPT-OSS vs. Qwen3 and a detailed look how things evolved since GPT-2 [200] - Sebastian Raschka 长文分析
- HN: What GPT-OSS leaks about OpenAI's training data [200] - 348 pts, 训练数据来源分析
社区讨论
- HN: GPT-OSS-120B runs on just 8GB VRAM & 64GB+ system RAM [200] - 248 pts, 8GB 显存实测
- HN: Running GPT-OSS-120B at 500 tokens per second on Nvidia GPUs [200] - 247 pts, Baseten 500 t/s 性能跑分
对比基准
- Hugging Face: openai/gpt-oss-20b 模型页 [200] - 下载量 / 社区微调衍生数
- Hugging Face: openai/gpt-oss-120b 模型页 [200] - 120B 版本
