OpenAI 在 DevDay 2026 期间正式发布 GPT-6.1 Sol。距离 GPT-6 Sol 和 Luna 发布仅过去一周左右,Sol 系列就迎来了第一次重要升级。

这次 GPT-6.1 Sol 的重点并不是单纯追求更高的模型能力,而是在 GPT-6 Sol 的成本基础上,尽可能接近 GPT-6 Astra 的性能。

GPT-6.1 Sol 定位:低成本接近 Astra

GPT-6.1 Sol 主要针对复杂编程、Computer Use、专业文档处理以及 Agent 工作流进行了强化。

OpenAI 表示,在多项复杂任务中,GPT-6.1 Sol 已经可以实现接近 GPT-6 Astra 的表现,但标准输入和输出 Token 的价格只有 Astra 的约 1/5。

对于需要大量调用模型的 Agent、企业 RAG、自动化工作流以及 Coding Agent 来说,这个差距会直接反映在运行成本上。

尤其值得注意的是缓存输入价格。

GPT-6.1 Sol 每百万缓存输入 Token 仅 0.10 美元,比普通输入 Token 便宜 95%。对于需要反复携带系统提示词、知识库内容、代码库上下文或者历史任务信息的 Agent 应用,这项价格调整非常重要。

编程能力进一步提升

GPT-6.1 Sol 在真实软件工程任务上的提升比较明显。

在 DeepSWE v1.1 测试中,GPT-6.1 Sol 使用较低推理强度时,就比 GPT-6 Sol 的最高成绩提升 6.4 个百分点,同时整体表现已经接近 GPT-6 Astra。

DeepSWE 并不是简单的代码补全测试,而是要求 AI Agent 在真实代码仓库中完成需要长期规划、代码修改、调试和执行的复杂软件工程任务。

因此 GPT-6.1 Sol 更明显的使用场景会是 Codex、Coding Agent、自动 Bug 修复、代码库分析和自动化开发,而不仅仅是聊天窗口中的代码生成。

PDF 和专业文档处理能力增强

在 GDP.pdf 测试中,模型需要理解包含大量表格、图表、示意图和小字体内容的复杂 PDF,并回答金融、医疗、法律等专业领域的问题。

GPT-6.1 Sol 在不同推理强度下都表现出了较强的复杂文档处理能力,同时单任务成本明显低于高端模型。

这类能力对于企业知识库和 RAG 应用比较实用。

例如财务报告、合同、产品说明书、技术手册、招投标文件以及企业内部 PDF,都属于典型应用场景。

Agent 自动化能力继续加强

在 AutomationBench 中,AI Agent 需要调用多达 47 种工具,完成销售、营销、运营、客服、财务和人力资源等端到端业务流程。

GPT-6.1 Sol 在中等推理强度下,相比相同设置的 GPT-6 Sol 提升 4.8 个百分点。

这意味着 GPT-6.1 Sol 的重点已经越来越明显地从“回答问题”转向“完成任务”。

对于需要模型连续完成:

读取数据 → 分析内容 → 调用工具 → 操作系统 → 验证结果 → 输出最终结果

这类多步骤流程的应用,GPT-6.1 Sol 会比上一代 Sol 更适合作为 Agent 的核心模型。

Computer Use 接近 Astra

计算机操作也是 GPT-6.1 Sol 提升比较明显的领域。

在 OSWorld 2.0 测试中,GPT-6.1 Sol 在最高推理强度下比 GPT-6 Sol 提升 7 个百分点。

更值得注意的是,它与 GPT-6 Astra 的差距已经缩小到 2.1 个百分点以内,而单任务成本大约只有 Astra 的 1/7。

对于需要 AI 操作浏览器、桌面软件、后台管理系统以及企业内部 Web 系统的场景,这种性能和成本组合会更加实用。

科学任务性能提升超过一倍

GPT-6.1 Sol 在科学研究任务上的提升幅度也很大。

Terminal-Bench Science 0.1 包括数据分析、模拟、模型拟合以及定理证明等任务。

在最高推理强度下,GPT-6.1 Sol 的成绩超过 GPT-6 Sol 的两倍,而平均单任务成本只有 5.47 美元。

作为对比,同一测试中 Opus 5.5 的平均成本为 23.21 美元,GPT-6 Astra 为 23.80 美元。

不过对于最困难的科学研究任务,GPT-6 Astra 仍然保持更高性能。

事实错误率进一步降低

GPT-6.1 Sol 也针对事实准确性进行了改进。

在 OpenAI 专门挑选的高难度提示测试中,最高推理强度下:

GPT-6 Sol 的事实错误率为 4.5%,GPT-6.1 Sol 降低到 4.1%,GPT-6 Astra 为 4.0%。

也就是说,在这组特定测试中,GPT-6.1 Sol 已经非常接近 Astra。

不过 OpenAI 特别强调,这些测试使用的是刻意选择的高难度问题,因此并不能直接代表普通用户日常使用时的错误率。

GPT-6.1 Sol API 价格

GPT-6.1 Sol 的模型名称为:

gpt-6.1-sol

标准 API Token 价格:

类型每百万 Token
输入$2.00
缓存输入$0.10
输出$10.00

模型支持最高 1,050,000 Token 上下文窗口,最大输出达到 128,000 Token。

同时支持 Function Calling、Structured Outputs、Web Search、File Search、Image Generation、Code Interpreter、Hosted Shell、Computer Use、MCP 和 Tool Search 等工具能力。

对于超长上下文,需要注意一个额外计费规则:当输入超过 272K Token 后,整个请求的输入及缓存价格按 2 倍计算,输出价格则提高到 1.5 倍。

ChatGPT 和 Codex 已经可以使用

GPT-6.1 Sol 已向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,可以在 ChatGPT Work 和 Codex 中使用。

目前 GPT-6.1 Sol 尚未进入普通 ChatGPT Chat 模型选择器。

API 开发者则可以直接调用 gpt-6.1-sol。

OpenAI 同时推出 GPT-6 Astra Ultrafast 和 GPT-6.1 Sol Ultrafast。Ultrafast 模式主要面向对生成速度要求更高的场景,最高速度可以达到 Astra 标准模式的约 8 倍。

OpenAI 还推出了新的每月 500 美元 Pro 档位,提供更高的使用额度,并开放相关 Ultrafast 模型。

从产品定位来看,GPT-6 系列现在已经形成了比较清晰的分层:

Luna 更强调速度和低成本,Sol 面向日常复杂任务,GPT-6.1 Sol 将性能进一步推近 Astra,而 Astra 继续负责最复杂、对模型能力要求最高的任务。

对于 API 开发者而言,GPT-6.1 Sol 最值得关注的地方可能并不是单项 Benchmark 的提升,而是 $2 / $10 的 Token 价格、$0.10 的缓存输入,以及接近 Astra 的 Agent 和 Computer Use 能力。对于需要持续运行大量 AI Agent 的应用,这会直接影响实际部署成本。