ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Artificial Analysis 评测 GPT-6 Sol/Luna:成本减半,能力有升有降

Artificial Analysis 评测 GPT-6 Sol/Luna:成本减半,能力有升有降

AI资讯 Admin 1 次浏览

2026年9月22日,第三方 AI 评测机构 Artificial Analysis 发布了 GPT-6 Sol 和 GPT-6 Luna 的独立评测报告。这是两款新模型发布后的第一份完整第三方成绩单:价格确实砍半,但能力变化并非一边倒——有的评测进步,有的退步。

Artificial Analysis 的核心测算显示,GPT-6 Sol 跑完一轮智能指数评测的成本约为 1.06 美元,比 GPT-5.6 Sol 的 1.99 美元便宜近一半;Luna 从 0.18 美元降到 0.07 美元,降幅约六成。智能指数总分与上一代基本持平,但在细分项上,编码智能体能力 Sol 小幅提升、Luna 小幅下滑,知识工作类评测两者都出现了回退。

降价是实的:API 价格直接腰斩

Sol 的输入/输出价格从每百万 token 4 美元/20 美元降到 2 美元/10 美元,Luna 从 0.20 美元/1.20 美元降到 0.10 美元/0.50 美元,缓存读取依然有 90% 折扣,缓存写入加价 25%。值得注意的是,两款新模型每个任务消耗的输出 token 反而略有增加(Sol 从 2.9 万涨到 3.1 万),成本下降完全来自降价本身。这次评测的对象,正是OpenAI 在 9 月 22 日发布的 GPT-6 Sol 和 Luna(本站稍早前已有发布报道)。

有升:编码与幻觉控制进步

在 Artificial Analysis 的 Coding Agent Index(基于 OpenAI 自家 Codex 工具链测得)中,Sol 拿到 57 分,比 GPT-5.6 Sol 高 2 分,Terminal-Bench 4.0 从 37% 提升到 43%。幻觉控制是另一大亮点:在 AA-Omniscience 知识问答评测里,Sol 的幻觉率从 92% 降到 60%,Luna 从 93% 降到 77%。不过 Sol 的策略是“更谨慎”——回答率从 99% 降到 83%,错答减少约四分之一,代价是准确率从 59% 掉到 54%。

有降:知识工作类评测双双回退

GDPval-AA v2.1(覆盖 44 种职业的经济价值任务)中,Sol 掉了约 100 个 Elo 分,Luna 掉了约 75 分;Luna 在多周知识工作项目评测 AA-Briefcase v1.1 里也掉了约 45 分。评测团队人工检查了数百条输出,认为回退主要来自“交付物变短、经常漏掉评分标准要求的要素”——模型为了省 token,把答案写得太简略了。

选型时看任务类型,别只看价格

如果你在 Codex 这类编码智能体里跑代码任务,Sol 是更划算的选择:分数更高,单任务成本 2.99 美元,比上一代便宜一半,正好落在“能力—成本”帕累托前沿上。如果你用 Luna 跑高频简单任务(抽取、摘要),成本优势依然明显;但涉及长文档、要交付完整报告的知识工作,建议先小流量验证输出完整性,再全量切换。

这次降价发生在 Anthropic 发布 Claude Opus 5.5(降价 20%)的同一天,两家顶级实验室在 24 小时内先后打出价格牌。Artificial Analysis 的结论很克制:OpenAI 拿下了成本效率前沿的一大块地盘,但“便宜”不等于“全面更强”。选模型时,关键看你的任务落在“升”的那一边还是“降”的那一边。

推荐工具

更多