9 月 29 日,OpenAI 在 DevDay 2026 上发布了 GPT-6.1 Sol:它是 GPT-6 Sol 的升级版,官方称其在智能体编码、computer use 和专业工作负载上的智能接近 GPT-6 Astra,而标准输入、输出 token 价格只有 Astra 的五分之一。
这次发布的核心是价格。API 标准定价为每百万输入 token 2 美元、输出 10 美元,缓存输入仅 0.10 美元——比标准输入便宜 95%,比 GPT-6 Sol 的缓存输入便宜一半。官方的说法是,这给了开发者更大的空间去构建和运行"跨请求复用上下文"的智能体。上线范围上,9 月 29 日起 ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise、Edu 用户可用,API 侧模型名为 gpt-6.1-sol;普通 Chat 对话暂未接入。未来几天还会推出 GPT-6.1 Sol Ultrafast,在 Codex 内 token 生成速度最高提升 8 倍。
跑分:在哪里追上了 Astra
- DeepSWE v1.1(真实代码库里的长程软件工程任务):GPT-6.1 Sol 与 Astra 持平,成本约为五分之一;比 GPT-6 Sol 最好成绩高 6.4 个百分点,且推理开销更低。
- GDP.pdf(用复杂 PDF 回答专业问题,含表格、图表和印刷细则):得分超过带 fallback 的 Opus 5.5,单任务成本不到一半;接近 Astra 的最高水平,成本约为五分之一。
- AutomationBench(47 个工具、横跨销售、市场、运营等部门的多步业务流程):中等推理强度下比 Opus 5.5 高 2.2 个百分点,成本约三分之一;比 GPT-6 Sol 高 4.8 个百分点。
- OSWorld 2.0 离线集(长程 computer-use 工作流):比 GPT-6 Sol 高 7 个百分点;最高推理强度下与 Astra 相差 2.1 个百分点,成本约为七分之一。
- Terminal-Bench Science 0.1(数据分析、仿真、定理证明等科学工作流):得分是 GPT-6 Sol 的两倍多,单任务平均成本 5.47 美元,而 Opus 5.5 为 23.21 美元、Astra 为 23.80 美元。
事实性与安全:犯错更少,也更"听话"
事实性评估中,低推理强度下含事实错误的回答占比从 11.4% 降到 7.7%,降幅约 32%,各档位与 Astra 的差距在 1.9 个百分点以内。对齐评估显示,GPT-6.1 Sol 在"搜索工具坏了是否如实告知""是否尊重显式限制""智能体任务中是否避免越权结果"等挑战项上的失败率低于 GPT-6 Sol;官方称未观察到模型尝试绕过自动化安全审查,与 Astra、GPT-6 Sol 持平。
意味什么:Astra 档按下暂停键之后,Sol 成了务实之选
就在几天前,OpenAI 宣布原定下月发布的 GPT-6.1 Astra 因安全对齐测试未达标而取消发布。Astra 的定位是极限智能,Sol 的定位是"够用的智能加敢用的价格"。对开发者来说,这次发布真正的信号是长程智能体任务的成本结构变了:缓存输入每百万 token 0.10 美元,意味着"把整个代码库上下文长期喂给智能体"从奢侈变成常规操作。代价也很清楚:它仍然不是 Astra,Terminal-Bench Science 上 Astra 的 68.1% 仍是全场最高分,最难的科学研究任务官方依然推荐用 Astra。