输入价格下调 20%、输出价格下调 33%,一文算清 GPT‑5.6 Sol 新价格对 Agent、代码生成与长上下文业务的真实影响
GPT‑5.6 Sol 的 API 价格迎来一次明确调整:每百万 Token 的标准输入价格从 5 美元降至 4 美元,输出价格从 30 美元降至 20 美元,缓存输入同步降至 0.40 美元。对输出占比较高的代码生成、Agent 和内容生产应用,实际节省幅度可能明显超过 20%。
需要先分清范围:这次变化针对按 Token 计费的 API 用量。它不能直接等同于 ChatGPT Plus、Pro、Business 等订阅价格调整,也不代表订阅套餐内的固定额度自动增加。

GPT‑5.6 Sol 最新价格是多少?
| 计费项目 | 原价格 / 百万 Token | 新价格 / 百万 Token | 降幅 |
|---|---|---|---|
| 标准输入 | 5 美元 | 4 美元 | 20% |
| 缓存输入 | 0.50 美元 | 0.40 美元 | 20% |
| 缓存写入 | 6.25 美元 | 5 美元 | 20% |
| 标准输出 | 30 美元 | 20 美元 | 约 33.3% |
官方模型页同时说明,这是一项促销价格,至少持续到 2026 年 11 月 21 日。因此,准备做年度预算或长期报价的团队,不应默认 4/20 美元会永久不变,而应保留价格回调空间。

到底能省多少钱?用一个 Agent 账单算清楚
假设一个大型 Agent 每月消耗 1 亿输入 Token、2000 万输出 Token:
- 调整前:100 × 5 美元 + 20 × 30 美元 = 1100 美元;
- 调整后:100 × 4 美元 + 20 × 20 美元 = 800 美元;
- 每月节省:300 美元,综合降幅约 27.3%。
实际降幅取决于输入与输出比例。文档检索、分类和抽取通常偏重输入,节省更接近 20%;代码生成、长报告、复杂 Agent 往往输出占比更高,综合降幅可能接近或超过 30%。

长上下文并不是统一按 4/20 美元计费
GPT‑5.6 Sol 提供 105 万 Token 级上下文窗口,但官方规则指出:当单次请求输入超过 272K Token 时,整次请求按更高倍率收费——输入为标准价的 2 倍,输出为标准价的 1.5 倍。
- 长上下文输入:约 8 美元 / 百万 Token;
- 长上下文输出:约 30 美元 / 百万 Token;
- 缓存仍然重要:稳定的系统提示词、工具说明和历史前缀应尽量命中缓存。
如果你要在 Codex 中使用超长上下文,可先阅读站内的 GPT‑5.6 Sol 百万上下文配置教程,同时关注上下文体积与成本,而不是只追求“窗口开满”。

为什么这次降价对 Codex 和编程 Agent 更敏感?
代码 Agent 不只读取需求,还会反复读取仓库、工具结果、终端输出和测试日志,并生成补丁、解释与总结。一次复杂任务可能包含多轮长输入和大量输出,所以 Token 单价会被任务循环放大。
对重度编程用户,降低成本的正确组合是:
- 复用稳定的仓库说明与系统提示词,提高缓存命中率;
- 限制无关文件进入上下文,减少重复读取;
- 按任务难度选择模型和推理强度,而不是所有任务都使用最高档;
- 让测试、格式化和静态检查先提供结构化结果,再交给模型判断;
- 持续记录单任务 Token、成功率与人工返工时间。
想了解 Codex 的功能和入口,可进入站内 Codex 导航页;关于服务内核优化,可继续阅读 GPT‑5.6 重写推理内核、降低服务成本的技术解析。

API 价格、Codex credits 和订阅套餐不是一回事
很多用户容易把三套计费方式混在一起:
| 使用方式 | 主要计费逻辑 | 本次价格变化如何理解 |
|---|---|---|
| OpenAI API | 按输入、缓存与输出 Token 计费 | 4 / 0.4 / 20 美元的新价格可直接用于估算 |
| Codex 按需 credits | 超出套餐包含用量后的额外消费 | 以账户实际显示的 credit 规则为准 |
| ChatGPT 订阅 | 按月订阅并包含相应产品权益 | 不能从 API 降价推导订阅费同步下降 |
因此,API 开发者可以立即重算成本;订阅用户则应以自己账户的套餐、区域和用量页面为准。不要通过账号共享、转售或把个人订阅转换为多人 API 服务来规避计费,这会带来账号与数据安全风险。

企业怎样把降价真正变成利润?
单价下降并不保证总账单下降。价格更低后,团队往往会扩大调用量、增加 Agent 轮次或把更多流程交给模型,最终支出可能不降反升。建议建立四项指标:
- 每个成功任务成本:不仅看 Token,还要包含失败重试;
- 缓存命中率:识别重复系统提示词和稳定上下文;
- 输出有效率:长答案中真正被产品使用的比例;
- 模型路由收益:简单任务是否可由 Terra、Luna 或其他低成本模型完成。
对于需要极致速度的任务,还可以参考 GPT‑5.6 Sol Ultrafast 模式解析。速度档位与 Token 单价属于不同维度,选型时应同时评估延迟、质量和总成本。

模型竞争进入“能力、速度、价格”三线并行
前沿模型的竞争已经不再只有基准测试。开发者会同时比较推理质量、工具调用稳定性、上下文容量、生成速度、区域可用性和价格。OpenAI 下调旗舰模型价格,意味着高难度任务的单位成本下降,也会促使其他闭源与开源模型继续调整定价和服务策略。
如果想比较匿名模型与百万上下文方案,可阅读 Ox Alpha 模型能力与风险解析;如果更关注本地运行和数据留在设备上,可参考 FreeToken 本地运行 MoE 大模型教程。

结论:输出型工作负载最受益,但要留意促销期限
GPT‑5.6 Sol 新价格把标准输入降至 4 美元、缓存输入降至 0.40 美元、输出降至 20 美元。对大量生成代码、报告和 Agent 工具结果的业务,输出降价是本次变化的核心价值。
开发者现在可以做三件事:用真实输入输出比重算月度成本;提高缓存命中率;把简单任务路由到更经济的模型。同时应记住,官方将当前价格标为至少持续至 2026 年 11 月 21 日的促销方案,长期合同与产品报价应留出调整余地。






