OpenAI 在 2026 年 8 月 22 日公布了新一轮 GPT-5.6 系列价格调整。此次调整的重点是旗舰模型 GPT-5.6 Sol,OpenAI 表示,在继续推进模型能力边界的同时,也在持续提高推理效率,因此决定将 GPT-5.6 Sol 的 API 和积分价格下调超过 20%。
这次调整并不是永久价格承诺,而是一项阶段性的优惠政策。目前 GPT-5.6 Sol 的促销价格预计至少持续到 2026 年 11 月 21 日,也就是大约 3 个月。
除了 OpenAI API,新价格还会逐步应用于符合条件的 ChatGPT Work 和 Codex 积分计划。不过,普通的 ChatGPT Plus、Pro 和 Business 订阅方案并没有因此调整订阅价格。
GPT-5.6 Sol 最新 API 价格
GPT-5.6 Sol 是 GPT-5.6 系列中的旗舰模型,主要面向复杂编程、Agent、专业知识工作以及高强度推理任务。
按照 OpenAI 最新价格体系,标准模式下短上下文请求的价格调整为:
| 项目 | 每 100 万 Token |
|---|---|
| 输入 Token | 4 美元 |
| 缓存输入 | 0.40 美元 |
| 缓存写入 | 5 美元 |
| 输出 Token | 20 美元 |
对于长上下文请求,价格则更高:
| 项目 | 每 100 万 Token |
|---|---|
| 输入 Token | 8 美元 |
| 缓存输入 | 0.80 美元 |
| 缓存写入 | 10 美元 |
| 输出 Token | 30 美元 |
也就是说,对于大多数常规 API 应用,开发者现在使用 GPT-5.6 Sol 时,可以按照 4 美元输入 + 20 美元输出/百万 Token 来估算成本。
GPT-5.6 Sol 支持约 105 万 Token 上下文窗口,最大输出可以达到 12.8 万 Token,因此 OpenAI 对超长上下文请求采用了不同的计费标准。
GPT-5.6 系列目前多少钱?
除了 Sol,目前 GPT-5.6 系列还有 Terra 和 Luna 两个主要型号。
标准短上下文模式下,目前三款模型的价格分别为:
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| GPT-5.6 Sol | $4.00 | $0.40 | $20.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
价格均按照 每 100 万 Token 计算。
其中 Sol 定位旗舰模型,适合复杂推理、编程和 Agent 工作;Terra 更偏向性能与成本之间的平衡;Luna 则主要面向高并发、成本敏感型任务。
值得注意的是,Terra 和 Luna 此前已经进行过一次幅度很大的降价。2026 年 7 月 30 日,OpenAI 将 Terra 价格下调 20%,Luna 价格直接下调 80%。这一次则轮到了旗舰型号 Sol。
经过连续两轮调整后,GPT-5.6 系列已经形成了非常明显的价格梯度。
例如,同样处理 100 万输入 Token,Sol 为 4 美元,Terra 为 2 美元,而 Luna 只需要 0.20 美元。对于分类、信息抽取、批量内容处理、简单 Agent 节点等不需要旗舰模型能力的任务,Luna 的成本已经明显降低。
Batch 批处理还能再便宜一半
如果业务并不要求实时返回结果,还可以使用 Batch 模式进一步降低成本。
以 GPT-5.6 Sol 为例,Batch 短上下文价格为:
输入:2 美元 / 100 万 Token
缓存输入:0.20 美元 / 100 万 Token
输出:10 美元 / 100 万 Token
基本相当于标准 API 价格的 50%。
Terra 的 Batch 输入价格为 1 美元、输出 6 美元;Luna 更低,输入只需要 0.10 美元,输出 0.60 美元。
因此,大规模离线数据处理、批量文档分析、内容审核、数据标注、知识库预处理等任务,如果对实时性要求不高,使用 Batch API 的成本会明显低于普通实时调用。
Fast Mode 价格更高
如果应用更关注响应速度,GPT-5.6 系列还提供 Fast Mode。
OpenAI 已在 7 月 30 日将原来的 Priority Processing 更名为 Fast Mode,API 中原有的 priority 参数仍然可以继续使用,同时也可以使用新的 fast 服务等级。
以 GPT-5.6 Sol 为例,Fast Mode 短上下文价格为:
输入:8 美元 / 100 万 Token
缓存输入:0.80 美元 / 100 万 Token
输出:40 美元 / 100 万 Token
相当于用更高的调用成本换取更快、更稳定的推理吞吐能力,更适合对延迟敏感的实时 AI 产品。
这样一来,GPT-5.6 实际上形成了比较清晰的三档 API 调用模式:
Batch 适合追求最低成本的大规模离线任务;
Standard 适合绝大多数普通 API 应用;
Fast Mode 则面向更加看重响应速度和吞吐量的实时业务。
GPT-5.6 Sol 降价的意义
GPT-5.6 Sol 最初公布的价格为每百万 Token 输入 5 美元、输出 30 美元。此次促销价格下,标准短上下文已经下降到 输入 4 美元、输出 20 美元。
其中输入成本下降 20%,而输出 Token 的价格下降幅度达到约 33%。
对于 Agent、编程助手、深度研究以及复杂 RAG 应用来说,输出 Token 往往占据相当大的成本比例,因此实际使用成本的下降可能比单纯看到“超过 20% 降价”更加明显。
同时,缓存输入只有普通输入价格的十分之一。对于拥有大量固定 System Prompt、工具定义、知识背景或者长上下文模板的 Agent 应用,合理使用 Prompt Cache,同样可以进一步降低调用成本。
另外,符合数据驻留要求的区域处理端点可能会在基础价格上增加 10% 的费用;通过 Amazon Bedrock 等第三方云平台使用 OpenAI 模型时,最终价格也可能与 OpenAI API 直连价格不同。
从目前的价格体系来看,OpenAI 正在把 GPT-5.6 拆分成更加明确的三级产品线:Sol 承担复杂任务,Terra 面向通用生产环境,而 Luna 则负责大量低成本、高并发任务。开发者不再需要所有请求都调用旗舰模型,而是可以根据任务复杂度在三个模型之间进行路由,从而进一步控制整个 AI 应用的 Token 成本。