Le 21 septembre 2026, l'organisme indépendant de benchmarks Artificial Analysis a publié son évaluation complète de Grok 4.7. La conclusion est nette : c'est une version « priorité aux capacités agentiques » — Grok 4.7 obtient 46 points à l'Intelligence Index (+2 par rapport à 4.6), propulsant xAI parmi les quatre premiers laboratoires IA au monde ; le vrai bond se joue du côté des agents de code.
Trois chiffres clés
Premièrement, le travail de connaissance agentique. Sur AA-Briefcase (benchmark privé pour le travail de connaissance agentique de longue haleine), Grok 4.7 atteint 1 657 Elo, soit +111 par rapport à Grok 4.6, derrière seulement Claude Opus 5 et Claude Fable 5.1 — solidement installé dans le peloton de tête. Sur GDPval-AA, il atteint 1 695 Elo, également +90 devant son prédécesseur.
Deuxièmement, les agents de code. Grok 4.7 (niveau de raisonnement xhigh) associé à Grok Build, l'agent de code maison de xAI, obtient 56 points au Coding Agent Index, +9 par rapport à 4.6 — quatrième place parmi les harnais natifs, derrière seulement Claude Fable 5.1, GPT-6 Astra et Claude Opus 5, et devant GPT-5.6 Sol. Dans le détail, DeepSWE v1.1 passe de 65 % à 73 %, et Terminal-Bench 4.0 bondit de 18 % à 33 %.
Troisièmement, le cadrage de Musk. Musk, citant cette évaluation, a déclaré que Grok 4.7 place xAI au troisième rang du codage agentique, derrière seulement Anthropic et OpenAI.
Le coût derrière les scores
Ces gains ne sont pas gratuits. Évalué au niveau de raisonnement xhigh, Grok 4.7 consomme environ 81 000 tokens de sortie par tâche de l'Intelligence Index — plus du double de Grok 4.6 (xhigh, ~38 000) et près du double de GPT-6 Astra (max, 27 000). La vitesse de sortie est d'environ 188 tokens/seconde, soit 7,1 minutes en moyenne par tâche.
Bonne nouvelle : les tarifs ne bougent pas — entrée/sortie toujours à 2 / 6 dollars par million de tokens, entrée en cache à 0,50 dollar ; la fenêtre de contexte reste à 500 000 tokens ; l'intensité de raisonnement est réglable de low à xhigh. Autrement dit, xAI a transformé « plus fort » en « plus de raisonnement pour plus de points » — et c'est vous qui contrôlez l'ampleur de la facture.
Comment lire cette mise à niveau
La stratégie de Grok 4.7 est claire : au lieu de courir après des gains marginaux en Q&R général, elle mise tout le budget de raisonnement sur les tâches agentiques — le travail de connaissance de longue haleine et les agents de code, les deux scénarios les plus directement commercialisables. La baisse du taux d'hallucination de 34 % à 29 % est un signal positif, mais la précision à 47 % contre 48 % stagne pratiquement : cette fois, c'est la « capacité à faire le travail » qui a gagné, pas « la connaissance en soi ».
Pour les développeurs, Grok Build plus Grok 4.7 vaut l'essai — mais faites d'abord le calcul de la facture d'inférence : les chiffres en xhigh sont spectaculaires, au quotidien c'est le niveau high qui sera probablement le véritable point d'équilibre qualité-prix.