2026年9月21日、第三者ベンチマーク機関のArtificial AnalysisがGrok 4.7の完全評価を公開しました。結論は明確です。これは「エージェント能力優先」のバージョンアップであり、Grok 4.7はIntelligence Indexで46点(4.6比+2点)を獲得し、xAIを世界のトップ4のAIラボの仲間入りさせました。真の飛躍はコーディングエージェントにあります。
3つの重要な数字
第一に、エージェント型ナレッジワーク。AA-Briefcase(長期的なエージェント型ナレッジワークのプライベートベンチマーク)でGrok 4.7は1657 Eloを記録し、Grok 4.6を111点上回り、Claude Opus 5とClaude Fable 5.1に次ぐ位置につけ、正式に第一集団入りしました。GDPval-AAでも1695 Eloと、前世代を90点リードしています。
第二に、コーディングエージェント。Grok 4.7(xhigh推論設定)と公式コーディングエージェントGrok Buildの組み合わせは、Coding Agent Indexで56点(4.6比+9点)を獲得。ネイティブハーネスの中では4位で、Claude Fable 5.1、GPT-6 Astra、Claude Opus 5に次ぎ、GPT-5.6 Solを上回りました。内訳では、DeepSWE v1.1が65%から73%へ、Terminal-Bench 4.0が18%から33%へと跳ね上がっています。
第三に、マスク氏の位置づけ。マスク氏はこの評価を引用し、Grok 4.7によってxAIはエージェント型コーディングでAnthropicとOpenAIに次ぐ3位になったと述べました。
スコアの裏にあるコスト
スコアアップはタダではありません。xhigh推論設定での評価において、Grok 4.7はIntelligence Indexの1タスクあたり約8.1万の出力トークンを消費します。これはGrok 4.6(xhigh、約3.8万)の2倍以上、GPT-6 Astra(max、2.7万)のほぼ2倍です。出力速度は約188トークン/秒、1タスクあたり平均7.1分かかります。
朗報は価格が据え置きなことです。入出力は100万トークンあたり2ドル/6ドルのまま、キャッシュヒット時の入力は0.5ドル。コンテキストウィンドウは50万トークンを維持し、推論強度はlowからxhighまで調整可能です。つまりxAIは「より強い」を「より多くの推論でより多くの点数を稼ぐ」形にし、請求額の増加幅はユーザーが自分でコントロールできるようになっています。
このアップグレードをどう見るか
Grok 4.7の戦略は明確です。汎用Q&Aの微差を追うのではなく、推論予算をエージェントタスクに全振りしました。長期ナレッジワークとコーディングエージェントは、商業化に最も近い2つのシナリオです。幻覚率が34%から29%に下がったのは好材料ですが、正答率は47%対48%とほぼ横ばいであり、今回勝ったのは「知識そのもの」ではなく「仕事をこなす能力」だと言えます。
開発者にとって、Grok Build+Grok 4.7は試す価値がありますが、まず推論コストの計算を。xhigh設定のスコアは華やかですが、日常使いではhigh設定こそがコスパのスイートスポットかもしれません。