Les faits : une règle ouverte pour évaluer l'IA dans les conversations de santé mentale
Le 23 septembre 2026, OpenAI a annoncé sur son blog officiel le lancement de MentalHealthBench — un benchmark ouvert destiné à mesurer la qualité des réponses des systèmes d'IA dans des conversations réalistes de santé mentale. Le benchmark a été co-créé avec plus de 80 professionnels de santé mentale agréés issus de 22 pays, et couvre tout le spectre des conversations : stress quotidien, relations, accompagnement des proches, jusqu'aux urgences de santé mentale.
MentalHealthBench comprend 1 215 conversations synthétiques et 5 262 critères d'évaluation rédigés par des experts. Lors de l'évaluation, le modèle répond à différents profils d'utilisateurs, et la notation se concentre sur quatre dimensions comportementales clés : la sécurité, la capacité à rechercher proactivement le contexte, le respect de l'autonomie de l'utilisateur et la fourniture de conseils concrets lorsque c'est approprié. OpenAI a indiqué que la méthodologie d'évaluation et les données synthétiques seront intégralement publiées, afin que d'autres chercheurs puissent reproduire les évaluations, examiner la méthode et même contester les conclusions.
Le contexte : les gens se confient à l'IA, mais l'évaluation n'a pas suivi
OpenAI indique que plus d'un milliard de personnes utilisent ChatGPT chaque semaine. De nombreux utilisateurs se confient à l'IA sur des difficultés relationnelles, du stress quotidien, ou cherchent des conseils pour prendre soin d'un proche — des conversations qui exigent de la précision, un jugement pratique et le respect de l'autonomie des personnes. Or, les évaluations précédentes de l'IA dans le domaine de la santé mentale se concentraient presque exclusivement sur des situations extrêmes comme les crises, avec des critères prédéfinis très larges, sans refléter le comportement réel des modèles sur l'ensemble du spectre conversationnel. HealthBench, publié par OpenAI en 2025, ne contenait lui aussi que peu de cas de santé mentale, évalués pour la plupart par des cliniciens extérieurs à la psychiatrie — un point que le monde académique a remis en question. MentalHealthBench vise précisément à combler ce vide.
L'impact : l'évaluation de la santé mentale devient un nouveau front de la sécurité des modèles
Cette publication a deux implications directes. D'abord, elle transforme la « capacité conversationnelle en santé mentale » en une mesure quantifiable et comparable — les scores obtenus seront cités à répétition dans les futurs rapports de modèles. Ensuite, la publication ouverte permet à des chercheurs indépendants de reproduire et de contester les résultats — ce qui est rare à l'heure où l'évaluation de la sécurité des modèles de pointe repose encore largement sur les déclarations des fournisseurs eux-mêmes. Le Dr Arthur Evans, directeur général de l'American Psychological Association, est cité dans l'annonce : la santé mentale est un continuum, et les systèmes d'IA qui dialoguent avec les humains le long de ce continuum doivent être ancrés dans la science clinique et l'expérience vécue.
Notre regard : une règle compte, mais ce n'est pas un permis
La valeur de MentalHealthBench est de rendre discutable et vérifiable la question « l'IA s'en sort-elle bien dans les conversations de santé mentale ? ». Cela ne signifie pas que les modèles les mieux notés soient aptes à un véritable soutien psychologique : aussi réalistes soient-elles, les conversations synthétiques ne remplacent ni la complexité ni les risques d'une consultation réelle. OpenAI souligne d'ailleurs dans son annonce que ChatGPT n'est pas un substitut à la thérapie ou aux soins professionnels. Pour les utilisateurs, le véritable message de cette nouvelle est que la sécurité des conversations d'IA en santé mentale entre dans une ère de mesure sérieuse — même si un long chemin sépare encore la performance mesurée de l'utilité clinique.
Q : MentalHealthBench classera-t-il les modèles dans un palmarès ? R : D'après les informations publiées à ce jour, l'accent n'est pas mis sur un classement officiel, mais sur une méthodologie d'évaluation ouverte et un jeu de données permettant aux chercheurs de reproduire les évaluations et de comparer les performances selon les scénarios.
Q : Qu'est-ce que ce benchmark apporte au grand public ? R : Le benchmark s'adresse d'abord aux développeurs de modèles et aux chercheurs. Pour les utilisateurs ordinaires, l'intérêt le plus direct est que les entreprises d'IA commencent à affiner la sécurité des conversations de santé mentale avec une règle bien plus précise.