ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Gemini 4 Argon arrive : 77,9 % sur DeepSWE, le nouveau fleuron de Google d'abord réservé aux partenaires sécurité

Gemini 4 Argon arrive : 77,9 % sur DeepSWE, le nouveau fleuron de Google d'abord réservé aux partenaires sécurité

Informations sur l’IA • Admin • • 7 vues

Gemini 4 Argon est le nouveau modèle phare de Google, annoncé le 30 septembre 2026, et la première sortie de la toute nouvelle famille Gemini 4. Dans son billet officiel, DeepMind le présente comme le début de « notre prochaine ère d'intelligence de pointe » : conçu pour le raisonnement profond sur des flux de travail complexes et de longue haleine, dans l'ingénierie logicielle réelle, le travail de connaissance en entreprise (juridique, finance) et la cyberdéfense.

Qui y accède en premier : les partenaires cybersécurité

Argon est d'abord réservé aux cyberdéfenseurs de confiance via le programme Fairwind, tandis que Google participe au processus volontaire d'accès anticipé aux modèles du gouvernement américain. Les clients API payants et les abonnés Google AI Ultra suivent ; développeurs, entreprises et consommateurs devront attendre. Un lancement échelonné « la sécurité d'abord, le reste ensuite » est inhabituel pour un modèle phare de Google — c'est déjà un signal : Google n'ose manifestement pas dévoiler d'un coup toutes les capacités de ce modèle.

Le bilan : premier partout en codage et travail intellectuel

  • DeepSWE v1.1 (tâches réelles d'ingénierie logicielle à long terme) : 77,9 %, nouveau record ; Claude Opus 5.5 a obtenu 74,2 % sur la même période et GPT-6 Astra 74,1 %.
  • La limite de tokens en sortie passe de 64K à un million complet : une seule exécution peut produire une trajectoire de raisonnement complète de plusieurs centaines de milliers de tokens. « Résoudre le problème difficile en une seule fois », c'est l'argument que Google répète sans cesse.
  • En tête de l'indice Vals (impact économique des travaux de finance, de codage, juridiques et fiscaux, pondéré par la part du PIB) ; n°1 sur AutomationBench (le benchmark de Zapier pour l'exécution de processus métier de bout en bout) avec 51,3 % ; record de 91,7 % sur LVBench pour la compréhension vidéo longue.
  • La cybersécurité est la distinction qu'Argon met le plus en avant : 68 % sur CWE-bench v1 pour la correction de vulnérabilités, premier ex æquo ; sur le benchmark de Gray Swan pour l'injection indirecte de prompt, le taux de réussite des attaques n'est que de 0,7 % (contre 8,5 % pour GPT-6 Astra) — le modèle de pointe le plus résistant aux injections à ce jour.

Le point le plus controversé : une version « sans garde-fous » pour les défenseurs

Google annonce qu'il fournira aux défenseurs de confiance et à ses propres équipes internes Argon « sans garde-fous cyber », afin qu'ils exploitent pleinement sa capacité défensive. L'entreprise de cybersécurité Wiz l'utilise déjà via l'initiative Scan for Good pour protéger des infrastructures publiques critiques, et a découvert lors d'une démonstration une vulnérabilité critique dans un logiciel médical utilisé par des hôpitaux dans le monde entier — un risque que les modèles de pointe précédents avaient manqué. Tout en ouvrant les vannes pour les défenseurs, Google renforce aussi quatre lignes de défense : contre les usages abusifs (refus des demandes CBRN et autres requêtes nuisibles), contre l'injection de prompt, surveillance de la chaîne de pensée pour empêcher toute exécution hors cadre, et durcissement des environnements de test en sandbox.

Le prix : d'abord au « prix plancher »

Le prix de lancement de l'API Argon est de 2 dollars par million de tokens en entrée et 10 dollars en sortie, avec 95 % de remise sur les entrées en cache — identique aux prix de lancement de GPT-6.1 Sol et Sonnet 5.5, et cinq fois moins que le tarif officiel de GPT-6 Astra (10/50 dollars). Après la période de lancement, il passera à 4/20 dollars. Trois laboratoires alignent désormais leurs prix de niveau phare sur la même ligne : « des performances de pointe au prix de commodité » est devenu le consensus du secteur ; la compétition ne porte plus sur le prix unitaire, mais sur le coût le plus bas par tâche accomplie.

Pourquoi ce lancement est crucial pour Google

Le rythme de Google sur la frontière s'est visiblement effrité cette année : Gemini 3.5 Pro a été reporté puis purement annulé, la ligne phare est restée bloquée au Gemini 3 de novembre 2025 pendant qu'OpenAI et Anthropic livraient GPT-6 et une nouvelle génération de Claude ; DeepMind a en outre connu un changement de direction et le départ de talents clés. Mais le bilan interne d'Argon est solide : il a aidé l'équipe quantique à optimiser de 40 % les ressources spatio-temporelles de sous-routines clés, libéré 300 To de mémoire dans les centres de données, et migre le noyau Fuchsia Zircon — plus de 800 000 lignes — de C/C++ vers Rust, avec une réécriture de libgav1 en Rust 2,7 fois plus rapide que l'original. Pour Google, Argon est plus qu'un modèle : c'est la preuve que « nous sommes toujours à la table ». Reste une question : la couronne des benchmarks se traduira-t-elle en coûts de tâche plus bas dans le trafic de production réel ?

Outils Recommandés

Plus