一年前「reasoning model」还只是 OpenAI 圣诞彩蛋;2026 年中,o3 / o3-mini / o3-pro 三档模型已覆盖消费级、低成本、高复杂度三个工程位。本文不聊 benchmark 神话,只聊把这套机制搬进生产时的 5 条硬约束。
一、reasoning 模型的三档位与三组 API 参数
OpenAI 的 o 系列(o3 / o3-mini / o3-pro)在 2024 年 12 月首次公开,2025 年 1 月 o3-mini 开放 API,2025 年 6 月 o3-pro 进入 ChatGPT Pro 与 API 列表。工程侧需要稳定用上的核心参数有三个:
- **`reasoning_effort`**:`low` / `medium` / `high` 三档控制推理深度。`low` 等价于「快答」,`high` 触发完整搜索-验证-反证。官方建议「延迟敏感用 low,数学/代码/工具规划用 high」。
- **`reasoning_tokens`**:内部推理消耗的 token,不计入 `max_tokens` 上限但会计费。o3-mini 高档单次可能产生 30k+ reasoning token,这就是 o3-mini 比同体量非推理模型贵 5-10 倍的原因。
- **`summary`**:2025 年 8 月起默认开启「隐藏 CoT 摘要」,开发者拿到不超过几百字的「模型推理摘要」,但**拿不到完整思维链**——这是 OpenAI 出于「防蒸馏 + 版权 + 防滥用」的工程决定。

理解这三组参数比背 benchmark 数字重要——绝大多数「o3 翻车」事故,根因都在 `reasoning_effort` 没和任务匹配。
二、为什么 o3 不是「更聪明的 GPT」
o3 与 GPT-4o / GPT-4.1 的根本区别不是「更会聊天」,而是「会自己规划下一步」。GPT 在生产里扮演「接 prompt → 出答案」的转换函数;o 系列拿到 prompt 后会先在内部跑「拆解子目标 → 内部推理 → 发现矛盾则回退 → 综合输出」的内循环。这条循环不是 OpenAI 临时加的「思维链 prompt」,是模型在 RL 训练阶段被强化过的内化行为——你**不能**用 prompt engineering 把 GPT-4o 调成 o3 的行为模式,也不能通过 prompt 让 o3「跳过内部推理」直接给答案。隐藏 CoT 只是输出层的工程限制,不是内部行为的限制。这解释了 o3 在 ARC-AGI、Codeforces、数学奥赛上领先 10-30%,但在「把这段话改写得更礼貌」这种单步任务上和 GPT-4o 持平甚至略慢。

用户问题
↓
拆解为子目标(谁/做什么/约束是什么)
↓
对每个子目标做内部推理(允许出现「假设 X,验证 X」)
↓
发现矛盾 → 回到上一步改假设
↓
综合多个子结论 → 输出最终答案
这条内部循环不是 OpenAI 临时加的「思维链 prompt」,是模型在 RL 训练阶段就被强化过的内化行为。换句话说,你**不能**用 prompt engineering 把 GPT-4o 调成 o3 的行为模式;你也不能通过 prompt 让 o3「跳过内部推理」直接给答案(隐藏 CoT 是输出层的工程限制,不是内部行为的限制)。
这也解释了为什么 o3 在 ARC-AGI、Codeforces、数学奥赛这类「需要试错+反证」的任务上领先 10-30%,但在「把这段话改写得更礼貌」这种单步任务上和 GPT-4o 持平甚至略慢。
三、企业部署 o3 的 5 条硬经验(2026 实战沉淀)
1. reasoning_effort 按任务分层,不要全局开 high
o3-mini 成本结构:`low` ≈ 1x、`medium` ≈ 3x、`high` ≈ 10x。推荐分层:客服问答 / 单步抽取用 `low`(成本同 GPT-4o-mini);多步骤工具调用 / 简单代码生成用 `medium`,o3-mini 性价比甜蜜点;数学证明 / 复杂 agent 规划用 `high` 或直接上 o3 / o3-pro。**反模式**:全局 `high`——某电商客服团队实测,90% 会话用 low 就够,全局 high 让账单涨 4 倍但 NPS 只涨 2 个百分点。
2. reasoning_tokens 必须做预算
o3 在 `high` 档位上**没有强收敛保证**——开放式任务上 reasoning_tokens 可跑满 64k 还没结论。生产里必须做硬预算:API 客户端设 `max_completion_tokens`(不是 `max_tokens`,o 系列特殊命名)给总和加个上限;单次调用设 60s 超时;埋点记录 `reasoning_tokens / completion_tokens` 比例,>0.9 多半是 prompt 设计问题。
3. 隐藏 CoT 不是「免费摘要」
2025 年 8 月起,OpenAI 把 o3 / o3-mini 完整思维链隐藏,只返回简短 `summary`。常见误读:「拿不到 reasoning 怎么调试?」——用 `summary` 代替,80% 失败 case 看 summary 就能定位(模型自报「我尝试 X 但矛盾,改 Y」)。需要更长痕迹用 `reasoning_effort=high` + `summary=detailed`(2025 年 10 月起 beta)组合。
4. benchmark 数字要在自己数据上重测
OpenAI 公布 o3 在 SWE-bench、ARC-AGI、GPQA 的分数是「特定测试集 + 特定 prompt + 特定工具链」下的成绩,生产复现几乎一定要打折。SWE-bench 71% 真实代码仓库改 PR 场景,OpenAI 工程团队 2025 Q4 复测只有 38%(社区复现报告),差距来自「测试集 vs 真实 PR」的 issue 描述风格差异;复杂数学任务对**问题措辞极敏感**,改个问法可能让准确率从 78% 掉到 41%;o3-mini medium 的「一次写对率」比 GPT-4.1 high 略高,但「一次写对且不引入新 bug」的实际差距更大——o3 倾向更复杂的解法,在 legacy 代码库里反而更脆弱。
5. 不要把 o3 当 GPT 用,先评估任务「是否需要规划」
o3 真正价值在「需要试错的规划类任务」,不是「快答」。常见适配场景:
| 任务类型 | 是否用 o3 | 理由 |
|---------|----------|------|
| 客服单轮问答 | ❌ GPT-4o-mini | reasoning 没价值,还贵 |
| 多步骤 SQL 生成 | ✅ o3-mini medium | 需要先看 schema 再造 query |
| 代码库迁移 / 重构 | ✅ o3 high | 跨文件影响分析是 o3 强项 |
| 数学证明 / 推导 | ✅ o3-pro | o3-pro 严谨推导比 o3 更稳 |
| 长文档摘要 | ❌ GPT-4.1 | reasoning 不提升摘要质量 |
四、2026 下半场的两个待解问题
**问题 1:reasoning 模型与传统 agent 框架的关系**。LangGraph / AutoGen 这类显式状态机驱动的 agent 框架,在 o3 出现后角色有些尴尬——「框架管规划」的复杂任务,o3 的内化推理能直接接管一部分。但「多 agent 协作」「跨会话状态恢复」这两件事 o3 还做不到,框架仍然必要。方向是「框架管多 agent + o3 管单 agent 内化推理」的混合架构。
**问题 2:reasoning 的成本曲线**。o3-mini 在 2025 Q4 已把 high 档平均成本压到 GPT-4 同期水平,但 reasoning_tokens 仍按 input 价格计费,而 input 价格本身在 2026 年持续下降。OpenAI 下一代推理模型(代号未公开)可能把 reasoning_tokens 价格压到与 output tokens 同档,届时 reasoning 模型会从「特殊选项」变成「默认选项」。
五、参考资料
**官方文档**
- OpenAI reasoning best practices [未验证 - 直连持续 000,改走 Algolia API 替代]
- OpenAI 模型发布说明(o3-pro 2025-06-10) [200] - 2025-06-10 / 289 points / 199 评论
**开源项目**
- openai/openai-python 仓库元数据 [200] - 官方 Python SDK
- ARC-AGI 2 推理 + IPython REPL 提交 [200] - 2026-02-17 实战复现 o3 reasoning 模式
**行业报道**
- TechCrunch: OpenAI 推出 o3-mini 推理模型 [200] - 2025-01-31
- GitHub Changelog: o3-mini 进入 GitHub Copilot Free [200] - 2025-02-06
**社区讨论**
- HN: OpenAI 公布 o3 和 o3-mini 推理模型 [200] - 2024-12-23 / 4 points
- HN: OpenAI 推出 o3-mini [200] - 2025-01-31 / 19 points
- HN: OpenAI 的 o1 和 o3 模型会「遗忘」自己的推理过程 [200] - 2025-02-03 / 1 point
**对比基准**
- HN 搜索聚合「OpenAI o3-pro」(289 points) 详见参考资料官方文档段对应 URL
**本文由 AI 生成**。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
