GPT-6 家族的选型问题,OpenAI 在 2026 年 10 月 2 日发布的官方指南《A model guide for the GPT-6 family》中给出了系统答案。指南不只列出三档价格,还把推理等级、提示缓存、提示词写法和长任务管理放在一起讲,为开发团队提供了一套成本与能力配置方法。
三档型号与价格
| 型号 | 输入 | 输出 | 缓存输入 | 定位 |
|---|---|---|---|---|
| GPT-6 Astra | 10 美元 | 50 美元 | 1 美元 | 最难的推理工作,需要最高智能时用 |
| GPT-6.1 Sol | 2 美元 | 10 美元 | 0.10 美元 | 智能接近 Astra,价格只有五分之一 |
| GPT-6 Luna | 0.10 美元 | 0.50 美元 | 0.01 美元 | 目标明确的规模化日常重复工作 |
以上价格均为每百万 token 计价。GPT-6.1 Sol 适合复杂编程、研究和 computer use;GPT-6 Luna 则面向提取发票字段、分类请求、生成结构化摘要这类可以大量重复的任务。三档之间价差最高达百倍,选错型号,成本会直接放大。
选型要连推理等级一起算
指南的核心原则是:把模型选择和推理等级一起看作智能与价格的权衡。推理等级 Low 适合提取事实、小修改等例行任务;Medium 适合需要判断的工作,如规划功能、比较方案;High 适合困难调试、深入分析和仔细审查;Extra high 和 Max 只应在 High 不够时测试,确认改进值回额外的时间和成本后才保留。这意味着团队不应默认全程用最高档,而应按任务难度分层调度。
提示缓存与上下文管理
缓存输入最多比未缓存便宜 95%。指南建议把稳定的指令和参考材料放在变化的任务细节之前,并保持工具定义一致,以提高缓存命中。长对话则可以用 compaction 压缩上下文,同时保留继续工作所需的状态,避免任务越做越贵、越做越慢。
提示词写法正在变化
OpenAI 开发者体验负责人 Eric Provencher 表示,模型理解细微差别和歧义的能力变强了,过去有用的过度具体指导,现在反而可能妨碍结果。指南要求给模型明确的任务书:想要的结果、给谁用、相关背景与约束,以及什么算做完。技能(skills)的描述要短而明确、说明何时运行;用明确的决策边界代替一律「先问我」的规则;「做完」的定义包括实现改动、运行它、检查结果、修复失败。
为数小时到数天的长任务设计
GPT-6 家族可以接手持续数小时到数天的任务。API 侧可通过 Responses WebSocket API 在模型工作时中途纠偏,更新会排队,不取消正在运行的工具;慢工具运行时,模型可先做不依赖它的工作;GPT-6.1 Sol 还支持在 Responses API 里把独立子任务分给子智能体并行处理,多智能体目前处于 beta。三个型号都能直接操作网站和桌面应用(computer use),原则是每一步选最可靠的最简方式:能用 API 或连接工具完成的,就不用去读屏幕点按钮。
团队案例提供了参照:Cognition 用 Astra 在没有任何先验信息的情况下,30 分钟内端到端查清并验证了一个涉及 5000 美元现金和 20 万 API 额度的支付 bug 修复;Harvey 用 Astra 加审计日志,在近 8000 份文档的语料上测试法律智能体;Invideo 用 Astra 做调色和校正任务,成功率约为原来的三倍。
需要提醒的是,这份指南没有公布三个型号的上下文窗口长度,规划超长上下文场景时仍需等待进一步信息。对正在选型的团队来说,指南的价值在于把决策从「选最强的」变成「按任务分层选」:日常任务用 Luna 压成本,复杂工作交给 Sol,真正的难题再上 Astra,再叠加推理等级和缓存策略,整体支出才可控。