ToolNavs Outils IA à découvrir
Proposer Connexion

Évaluation des modèles d'IA

Changez le jeu de questions et le même modèle bouge de plusieurs places : un classement n'est pas un bulletin, c'est une coupe prise depuis le point de vue de l'examinateur. Ce tag suit la fabrication des benchmarks, la conception des graders et les moyens d'éviter les scores gonflés.

Le plus difficile, dans l'évaluation, n'est pas de rédiger des questions mais de garantir que le score mesure réellement une capacité. UNO-Bench unifie 44 types de tâches sur cinq combinaisons de modalités et fournit un grader général qui maintient la cohérence du scoring automatisé autour de 95 %. AMO-Bench va plus loin en commandant 50 problèmes inédits de niveau IMO à des experts humains, précisément pour empêcher la mémorisation des données d'entraînement de gonfler les résultats : la plupart des modèles restent sous 40 %. L'évaluation à un seul tour ne tient pas face aux agents. L'équipe d'ingénierie d'Anthropic conseille de partir de 20 à 50 cas d'échec réels, de donner à chaque tâche une solution de référence qui passe et un barème explicite, de couvrir à la fois ce qu'il faut faire et ce qu'il ne faut pas faire, et d'exécuter chaque essai dans un environnement isolé pour que ni l'état partagé ni les caches ne fassent monter le chiffre. Le choix de la métrique compte aussi : pass@k demande si l'une des tentatives réussit, pass^k si toutes réussissent — seul le second correspond à un produit qui doit marcher à chaque fois.