ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
DeepSeek V4.1 Flash améliore ses scores ARC-AGI : le raisonnement abstrait progresse, le coût par tâche aussi

DeepSeek V4.1 Flash améliore ses scores ARC-AGI : le raisonnement abstrait progresse, le coût par tâche aussi

Informations sur l’IA • Admin • • 5 vues

Les derniers résultats de DeepSeek V4.1 Flash ont été publiés par ARC Prize le 6 octobre 2026 : dans l'évaluation ARC-AGI (Verified), l'organisme d'évaluation indépendant lui attribue 94,5 % sur ARC-AGI-1 et 72,9 % sur ARC-AGI-2. Le raisonnement abstrait a franchi un pas de plus, mais le coût de chaque tâche résolue a lui aussi nettement augmenté.

Les progrès en détail

Par rapport aux meilleurs résultats de la génération précédente, V4 Flash, sur la même évaluation, ARC-AGI-1 gagne 5,5 points de pourcentage et ARC-AGI-2 en gagne 11,5. ARC-AGI ne récompense pas la mémorisation : chaque tâche ne donne que quelques exemples d'entrée et de sortie et demande au modèle de déduire lui-même la règle de transformation, puis de l'appliquer à une grille inédite ; ARC-AGI-2 exige en outre de gérer plusieurs règles entremêlées à la fois, raison pour laquelle la progression sur la deuxième génération en dit davantage. Le volet coût raconte l'autre moitié de l'histoire : environ 0,07 dollar par tâche sur ARC-AGI-1 et environ 0,13 dollar sur ARC-AGI-2, soit plusieurs fois le coût associé aux meilleurs scores de la génération précédente. Autrement dit, ce progrès a été acheté en dépensant plus généreusement en calcul de raisonnement ; ce n'est pas un repas gratuit.

Pourquoi les chiffres de coût comptent autant que les scores

Qu'ARC Prize publie le coût à côté de la précision est en soi une position : un benchmark qui annonce des scores sans la facture a une valeur limitée pour ceux qui exploitent réellement des modèles. Pour les développeurs, un score de 72,9 % sur ARC-AGI-2 signifie une option de plus pour les tâches à règles inconnues, avec un coût par tâche toujours de l'ordre d'une douzaine de centimes — une autre ligue que les factures de raisonnement de plusieurs dollars des grands modèles fermés. Mais dès que le volume de tâches devient énorme, un coût multiplié doit entrer dans le budget total, surtout pour les flux de travail d'agents qui empilent la précision par essais répétés, dont la facture gonfle le plus vite.

Deux précautions à la lecture de ces chiffres

Premièrement, ces résultats proviennent du jeu vérifié de l'organisme d'évaluation, sous des réglages fixes ; changer la méthode d'invite ou le niveau de raisonnement fera bouger à la fois le score et le coût, ils ne valent donc pas promesse pour un scénario métier. Deuxièmement, être fort en raisonnement abstrait ne signifie pas dominer les tâches quotidiennes comme le code ou les longs documents ; le choix d'un modèle exige toujours des tests sur son propre jeu de tâches. Le vrai signal est ailleurs : le camp chinois des modèles ouverts continue de se rapprocher du premier groupe dans l'évaluation de raisonnement général la plus difficile, et la compétition se déplace de la simple chasse aux scores vers la quantité de raisonnement qu'achète chaque dollar.

Outils Recommandés

Plus