Die Fakten: ein offener Maßstab für KI in Gesprächen über psychische Gesundheit
Am 23. September 2026 hat OpenAI in seinem offiziellen Blog die Veröffentlichung von MentalHealthBench bekannt gegeben – eines offenen Benchmarks, der misst, wie KI-Systeme in realistischen Gesprächen über psychische Gesundheit antworten. Der Benchmark entstand gemeinsam mit mehr als 80 zugelassenen Psychologinnen, Psychologen und Psychiatern aus 22 Ländern und deckt das gesamte Spektrum ab: von Alltagsstress, Beziehungen und Fürsorge bis hin zu psychiatrischen Notlagen.
MentalHealthBench umfasst 1.215 synthetische Dialoge und 5.262 von Expertinnen und Experten verfasste Bewertungskriterien. Bei der Bewertung antwortet ein Modell auf unterschiedliche Nutzer-Personas; die Benotung konzentriert sich auf vier zentrale Verhaltensdimensionen: Sicherheit, ob das Modell aktiv den Kontext erfragt, ob es die Selbstbestimmung des Nutzers wahrt und ob es gegebenenfalls handlungsorientierte Hinweise gibt. OpenAI erklärt, Bewertungsmethodik und synthetische Daten würden vollständig offen gelegt, sodass andere Forschende die Evaluierungen reproduzieren, die Methode prüfen und die Schlussfolgerungen sogar anfechten können.
Hintergrund: Menschen vertrauen der KI Persönliches an – die Bewertung hielt nicht Schritt
Laut OpenAI nutzen mehr als eine Milliarde Menschen pro Woche ChatGPT. Viele erzählen der KI von Beziehungskrisen und Alltagsstress oder suchen Rat bei der Pflege Angehöriger – Gespräche, die Genauigkeit, praktisches Urteilsvermögen und Respekt vor der Selbstbestimmung verlangen. Bisherige Evaluierungen von KI im Bereich psychischer Gesundheit konzentrierten sich jedoch fast ausschließlich auf extreme Krisensituationen und arbeiteten mit breiten, vorab definierten Kriterien – sie spiegelten nicht wider, wie Modelle über das gesamte Gesprächsspektrum hinweg wirklich agieren. Auch der 2025 von OpenAI veröffentlichte Benchmark HealthBench enthielt nur wenige Fälle zur psychischen Gesundheit, die zudem überwiegend von Ärzten außerhalb der Psychiatrie bewertet wurden – was die Fachwelt an seiner Belastbarkeit zweifeln ließ. Genau diese Lücke soll MentalHealthBench schließen.
Wirkung: Bewertung psychischer Gesundheit wird zum neuen Spielfeld der Modellsicherheit
Die Veröffentlichung hat zwei unmittelbare Bedeutungen. Erstens wird „Gesprächskompetenz im Bereich psychischer Gesundheit“ zu einer quantifizierbaren, vergleichbaren Kennzahl – die Punktzahlen werden künftig in Modellberichten immer wieder zitiert werden. Zweitens ermöglicht die offene Veröffentlichung unabhängigen Forschenden, Ergebnisse selbst zu reproduzieren und zu hinterfragen – ungewöhnlich in einer Zeit, in der die Sicherheitsbewertung von Frontier-Modellen noch immer weitgehend auf den Selbstdarstellungen der Anbieter beruht. Dr. Arthur Evans, CEO der American Psychological Association, wird in der Ankündigung mit den Worten zitiert, psychische Gesundheit sei ein Kontinuum, und KI-Systeme, die Menschen entlang dieses Kontinuums begleiteten, müssten in klinischer Wissenschaft und gelebter Erfahrung verankert sein.
Einordnung: Ein Maßstab zählt – ist aber keine Lizenz
Der Wert von MentalHealthBench liegt darin, dass die Frage „Wie gut schlägt sich KI in Gesprächen über psychische Gesundheit?“ diskutierbar und überprüfbar wird. Das heißt nicht, dass hoch bewertete Modelle für reale psychologische Unterstützung geeignet wären: So realistisch sie sein mögen, synthetische Dialoge ersetzen nicht die Komplexität und die Risiken echter Beratung. OpenAI selbst betont in der Ankündigung, dass ChatGPT kein Ersatz für Therapie oder professionelle Versorgung ist. Für Nutzerinnen und Nutzer bedeutet diese Nachricht vor allem: Die Sicherheit von KI-Gesprächen im Bereich psychischer Gesundheit tritt in eine Phase ernsthafter Messung ein – doch zwischen gemessener Leistung und klinischer Tauglichkeit liegt noch ein weiter Weg.
F: Wird MentalHealthBench Modelle in einer Rangliste führen? A: Nach den bislang veröffentlichten Informationen steht keine offizielle Rangliste im Vordergrund, sondern eine offene Bewertungsmethodik und ein Datensatz, mit dem Forschende Evaluierungen reproduzieren und die Leistung je nach Szenario vergleichen können.
F: Was bringt der Benchmark den Menschen im Alltag? A: Der Benchmark richtet sich in erster Linie an Modellentwickler und Forschende. Für Nutzerinnen und Nutzer ist die unmittelbarere Bedeutung, dass KI-Unternehmen die Sicherheit von Gesprächen über psychische Gesundheit nun mit einem deutlich feineren Maßstab weiterentwickeln.