2026年9月21日,第三方评测机构 Artificial Analysis 发布 Grok 4.7 完整评测。结论很集中:这是一次"智能体能力优先"的版本升级——Grok 4.7 在 Intelligence Index 拿到 46 分(比 4.6 高 2 分),把 xAI 送进全球前四的 AI 实验室行列;真正的跳跃发生在编码智能体上。
三个关键数字
第一,智能体知识工作。AA-Briefcase(长周期智能体知识工作私有基准)1657 Elo,比 Grok 4.6 高 111 分,仅次于 Claude Opus 5 和 Claude Fable 5.1,正式进入第一梯队;GDPval-AA 1695 Elo,同样领先上代 90 分。
第二,编码智能体。Grok 4.7(xhigh 推理档)搭配官方编码智能体 Grok Build,在 Coding Agent Index 拿到 56 分,比 4.6 高 9 分;在原生 harness 的排名中位列第四,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5,超过了 GPT-5.6 Sol。分项看,DeepSWE v1.1 从 65% 涨到 73%,Terminal-Bench 4.0 从 18% 翻到 33%。
第三,马斯克的定调。马斯克引用这份评测表示,Grok 4.7 让 xAI 在智能体编码领域排名第三,仅次于 Anthropic 和 OpenAI。
分数背后的成本账
涨分不是免费的。评测在 xhigh 推理档下进行,Grok 4.7 每个 Intelligence Index 任务平均消耗约 8.1 万输出 token,是 Grok 4.6(xhigh,约 3.8 万)的两倍多,比 GPT-6 Astra(max,2.7 万)多出近两倍。输出速度约 188 token/秒,平均每个任务跑 7.1 分钟。
好消息是定价没涨:输入输出仍是每百万 token 2 美元 / 6 美元,缓存命中的输入 0.5 美元;上下文窗口维持 50 万 token;推理强度从 low 到 xhigh 可调。换句话说,xAI 把"更强"做成了"用更多推理换更多分数",账单涨幅用户自己可控。
怎么看这次升级
Grok 4.7 的策略很清晰:不去卷通用问答的边际提升,把推理预算押注到智能体任务上——长周期知识工作和编码代理恰好是商业化最直接的两个场景。幻觉率从 34% 降到 29% 是个积极信号,但准确率 47% 对 48% 基本原地踏步,说明这次赢的是"干活能力",不是"知识本身"。
对开发者来说,Grok Build 加 Grok 4.7 值得一试,但要先算好推理账单:xhigh 档的分数很漂亮,日常用 high 档可能才是性价比的甜点区。