Am 21. September 2026 hat die unabhängige Benchmark-Organisation Artificial Analysis ihre vollständige Grok-4.7-Evaluierung veröffentlicht. Das Fazit ist eindeutig: Dies ist ein Release mit Priorität auf Agenten-Fähigkeiten – Grok 4.7 erreicht 46 Punkte auf dem Intelligence Index (+2 gegenüber 4.6) und katapultiert xAI unter die vier führenden KI-Labore der Welt; der eigentliche Sprung gelingt bei den Coding-Agenten.
Drei Schlüsselzahlen
Erstens: agentische Wissensarbeit. Auf AA-Briefcase (privater Benchmark für langfristige agentische Wissensarbeit) erzielt Grok 4.7 1.657 Elo, +111 gegenüber Grok 4.6, und liegt damit nur hinter Claude Opus 5 und Claude Fable 5.1 – fest in der Spitzengruppe. Auf GDPval-AA erreicht es 1.695 Elo, ebenfalls +90 vor dem Vorgänger.
Zweitens: Coding-Agenten. Grok 4.7 (Reasoning-Stufe xhigh) zusammen mit xAIs eigenem Coding-Agenten Grok Build erzielt 56 Punkte auf dem Coding Agent Index, +9 gegenüber 4.6 – Platz vier unter nativen Harnesses, hinter nur Claude Fable 5.1, GPT-6 Astra und Claude Opus 5, und vor GPT-5.6 Sol. Im Detail steigt DeepSWE v1.1 von 65 % auf 73 %, Terminal-Bench 4.0 springt von 18 % auf 33 %.
Drittens: Musks Einordnung. Musk zitierte die Evaluierung und erklärte, Grok 4.7 bringe xAI beim agentischen Coding auf Platz drei – hinter nur Anthropic und OpenAI.
Die Kosten hinter den Punkten
Die Zuwächse sind nicht gratis. Evaluiert auf Reasoning-Stufe xhigh verbraucht Grok 4.7 rund 81.000 Output-Tokens pro Intelligence-Index-Aufgabe – mehr als das Doppelte von Grok 4.6 (xhigh, ca. 38k) und fast doppelt so viel wie GPT-6 Astra (max, 27k). Die Ausgabegeschwindigkeit liegt bei etwa 188 Tokens/Sekunde, im Schnitt 7,1 Minuten pro Aufgabe.
Die gute Nachricht: Die Preise bleiben unverändert – Input/Output weiterhin 2 / 6 US-Dollar pro Million Tokens, Cache-Hit-Input 0,50 US-Dollar; das Kontextfenster bleibt bei 500.000 Tokens; die Reasoning-Stärke ist von low bis xhigh einstellbar. xAI hat „stärker" also in „mehr Reasoning für mehr Punkte" verwandelt – und wie stark die Rechnung steigt, kontrolliert man selbst.
Wie man dieses Upgrade einordnet
Grok 4.7s Strategie ist klar: Statt marginale Zugewinne bei allgemeinem Q&A zu jagen, setzt es das Reasoning-Budget auf Agenten-Aufgaben – langfristige Wissensarbeit und Coding-Agenten, die beiden Szenarien mit der direktesten Kommerzialisierung. Dass die Halluzinationsrate von 34 % auf 29 % sinkt, ist ein positives Signal; doch die Genauigkeit liegt mit 47 % zu 48 % praktisch auf der Stelle – gewonnen hat diesmal also die „Arbeitsleistung", nicht das „Wissen an sich".
Für Entwickler lohnt sich Grok Build plus Grok 4.7 – aber erst die Inferenzrechnung aufmachen: Die xhigh-Werte sehen glänzend aus, im Alltag dürfte high der eigentliche Sweet Spot fürs Preis-Leistungs-Verhältnis sein.