ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Étude comptable de Mercor : les modèles de pointe réussissent tout, les experts-comptables plafonnent à 37 %

Étude comptable de Mercor : les modèles de pointe réussissent tout, les experts-comptables plafonnent à 37 %

Informations sur l’IA • Admin • • 5 vues

L'étude comparative de Mercor sur la comptabilité a été publiée le 2 octobre 2026 par Mercor sur son blog officiel : douze comptables juniors, tous experts-comptables diplômés avec cinq ans et demi d'expérience en moyenne, ont affronté des modèles de pointe sur les mêmes tâches de clôture mensuelle. Le résultat est sans appel : les comptables atteignent environ 37 % en moyenne, tandis que des modèles comme Claude Opus 5 obtiennent le score parfait sur les 20 tentatives, en moins de 10 minutes par tâche, contre 30 à 180 minutes pour les humains.

Pas un quiz : fouiller des dossiers pour trouver les bons chiffres

Les tâches proviennent du benchmark APEX-Accounting publié plus tôt par Mercor : quatre scénarios réalistes de clôture mensuelle. Les participants devaient fouiller les fichiers de travail d'une entreprise pour trouver les bons chiffres, calculer, puis livrer un tableau de résultats. Les scénarios cachaient des exigences comptables faciles à manquer mais réalistes, qui se cumulaient, si bien qu'un chiffre oublié pouvait effondrer le score. L'étude devait mesurer l'apport de l'IA aux humains, mais les modèles ayant atteint la perfection seuls, il ne restait aucun gain à mesurer ; Mercor a donc publié la comparaison directe entre humains sans aide et modèles.

L'écart de coût dépasse l'écart de vitesse

Par critère d'évaluation satisfait, Claude Opus 5 coûte environ 0,21 dollar, contre environ 10,35 dollars pour les comptables au salaire médian américain, soit un écart d'environ 49 fois. Il y a dix-huit mois, les meilleurs modèles n'atteignaient pas les 37 % des comptables ; o3 d'OpenAI a franchi cette ligne au printemps 2025, GPT-5 a atteint environ 69 %, et les modèles de pointe touchent aujourd'hui le score parfait. Il reste des exceptions : certains modèles économiques ou ouverts, comme Qwen3.5-122B, restent sous la moyenne des comptables.

Un score parfait ne rend pas les comptables remplaçables

Mercor pose lui-même les limites. Les tâches mesuraient précisément ce que les modèles font le mieux : retrouver des détails dans des fichiers et suivre des instructions à la lettre. La communication client, l'art de poser les bonnes questions et le contexte métier accumulé, une grande partie du métier, n'étaient pas testés. Les conditions désavantageaient aussi les humains : aucun collègue à consulter, aucun contexte préalable, et des tâches dont les concepteurs attendaient eux-mêmes environ 30 % pour des juniors, le benchmark ayant été conçu pour faire échouer les modèles. Ce que l'étude montre vraiment, c'est que le travail de clôture structuré et dense en détails bascule vers les modèles, tandis que le jugement, la communication et le contrôle gagnent en valeur. Pour les équipes finance, la réponse pratique consiste à confier rapprochements, recherches et premiers brouillons aux modèles, et à consacrer le temps humain à la vérification et à l'explication.

Outils Recommandés

Plus