事实:一个专门给 AI 心理健康对话打分的公开标尺
2026 年 9 月 23 日,OpenAI 在官方博客宣布发布 MentalHealthBench——一个用于衡量 AI 系统在真实心理健康对话中表现的开放基准。该基准由 OpenAI 与来自 22 个国家的 80 多位持证心理健康专家共同创建,覆盖从日常压力、情感关系、照护他人到心理健康紧急情况的完整对话谱系。
MentalHealthBench 包含 1,215 段合成对话和 5,262 条由专家撰写的评分标准。评测时,模型需要回应不同身份的用户画像,评估聚焦四个关键行为维度:安全性、是否主动追问情境、是否保护用户自主性,以及是否在适当时给出可行动的建议。OpenAI 表示,基准的评测方法与合成数据将全部公开,其他研究者可以直接复现评测、审视其方法,乃至对结论提出质疑。
背景:人们正在把 AI 当成倾诉对象,但评测一直缺位
OpenAI 披露,每周使用 ChatGPT 的人数已超过十亿。大量用户会向 AI 倾诉感情困境、日常压力,或为照顾亲友寻求建议——这类对话要求准确、实用的判断,以及对人自主权的尊重。然而,过去针对心理健康场景的 AI 评测大多只关注危机等极端情形,且用宽泛的预设标准打分,无法反映模型在整个对话谱系上的真实表现。OpenAI 2025 年发布的 HealthBench 也只包含少量心理健康案例,且多数由非精神健康领域的临床医生打分,可靠性受到学界质疑。MentalHealthBench 正是为了填补这一空白。
影响:心理健康评测成为模型安全的新赛道
这套基准的发布有两层直接影响。其一,它把"心理健康对话能力"变成可量化、可比较的指标,模型在其中的得分高低,将成为未来模型报告中被反复引用的数字。其二,开放发布让外部研究者能独立复现和挑战评测结果——这在当前大模型安全评估普遍依赖厂商自述的背景下并不多见。美国心理学会 CEO Arthur Evans 在公告中评价,心理健康是一个连续体,在此谱系上与人对话的 AI 系统,需要以临床科学和真实经验为根基。
怎么看:标尺重要,但标尺不是通行证
MentalHealthBench 的价值,在于让"AI 在心理健康对话中做得好不好"变得可讨论、可验证。但这并不意味着高分模型就能胜任真实的心理支持:合成对话再逼真,也替代不了真实咨询中的复杂性和风险。OpenAI 自身也在公告中强调,ChatGPT 不是治疗或专业照护的替代品。对用户而言,这条新闻的真正含义是:AI 对话的心理健康安全性正在进入"被认真测量"的阶段,但测量结果与临床可用之间,仍然隔着很远的距离。
Q:MentalHealthBench 会给模型排名吗? A:目前公开的信息强调它是一套开放评测方法与数据集,重点在于让研究者能复现、比对模型在不同场景下的表现,而非发布官方排行榜。
Q:普通人能从这个基准中得到什么? A:基准主要面向模型开发者和研究者。对普通用户而言,更直接的意义在于:AI 公司开始用更细致的标尺,打磨心理健康对话的安全性。