사실: AI 정신건강 대화를 평가하는 공개된 자
2026년 9월 23일, OpenAI는 공식 블로그를 통해 MentalHealthBench를 발표했다. AI 시스템이 현실적인 정신건강 대화에서 어떤 응답을 하는지 측정하기 위한 공개 벤치마크다. 22개국 80명 이상의 공인 정신건강 전문가와 공동으로 만들었으며, 일상 스트레스와 인간관계, 돌봄부터 정신건강 응급 상황까지 대화의 전 스펙트럼을 다룬다.
MentalHealthBench는 1,215개의 합성 대화와 전문가가 작성한 5,262개의 평가 기준으로 구성된다. 평가에서 모델은 서로 다른 사용자 페르소나에 응답해야 하며, 네 가지 핵심 행동 차원에 초점을 맞춰 점수를 매긴다: 안전성, 맥락을 적극적으로 묻는지, 사용자의 자율성을 존중하는지, 적절한 상황에서 실행 가능한 조언을 제시하는지. OpenAI는 평가 방법론과 합성 데이터를 모두 공개해 다른 연구자가 평가를 재현하고 방법을 검증하며 결론에 이의를 제기할 수도 있다고 밝혔다.
배경: 사람들은 AI를 상담 상대로 삼고 있지만 평가는 뒤처져 있었다
OpenAI에 따르면 매주 ChatGPT를 사용하는 사람은 10억 명이 넘는다. 많은 사용자가 AI에게 연애 고민과 일상 스트레스를 털어놓고, 가족 돌봄에 대한 조언을 구한다. 이런 대화에는 정확하고 실용적인 판단력과 사람의 자율성에 대한 존중이 요구된다. 그러나 지금까지 정신건강 분야의 AI 평가는 위기 같은 극단적 상황에 치우치고 폭넓게 사전 정의된 기준으로 점수를 매기는 방식이 대부분이어서, 모델이 전체 대화 스펙트럼에서 실제로 어떻게 행동하는지 반영하지 못했다. OpenAI가 2025년 발표한 HealthBench 역시 정신건강 사례가 극소수였고, 대부분을 정신건강 분야가 아닌 임상의가 채점해 학계의 신뢰성 의문을 받았다. MentalHealthBench는 바로 이 공백을 메우기 위한 것이다.
영향: 정신건강 평가는 모델 안전의 새로운 전선이 된다
이 벤치마크 공개는 두 가지 직접적인 의미를 갖는다. 첫째, '정신건강 대화 능력'이 정량화되고 비교 가능한 지표가 되면서, 앞으로 모델 보고서에서 점수가 반복 인용될 것이다. 둘째, 공개 배포 덕분에 외부 연구자가 결과를 독립적으로 재현하고 검증할 수 있다. 프런티어 모델의 안전성 평가가 여전히 기업 자체 설명에 의존하는 현실에서 흔치 않은 일이다. 미국심리학회 Arthur Evans CEO는 발표문에서 정신건강은 연속체이며, 그 연속체 위에서 사람과 대화하는 AI 시스템은 임상 과학과 실제 경험에 뿌리를 두어야 한다고 평가했다.
관점: 자는 중요하지만 자가 면허증은 아니다
MentalHealthBench의 가치는 'AI의 정신건강 대화가 잘 되고 있는가'를 논의 가능하고 검증 가능하게 만들었다는 점이다. 하지만 고득점 모델이 곧 실제 심리 지원에 투입될 수 있다는 뜻은 아니다. 아무리 사실적이라도 합성 대화는 실제 상담의 복잡성과 위험을 대체할 수 없다. OpenAI 스스로도 발표에서 ChatGPT가 치료나 전문적 돌봄의 대체재가 아니라고 강조했다. 사용자에게 이 뉴스의 진짜 의미는 AI 대화의 정신건강 안전성이 '진지하게 측정되는' 단계에 들어섰다는 것이지만, 측정 결과와 임상 활용 사이에는 여전히 먼 거리가 있다는 점이다.
Q: MentalHealthBench가 모델 순위를 발표하나요? A: 현재까지 공개된 정보가 강조하는 것은 공식 순위 발표가 아니라, 연구자들이 평가를 재현하고 시나리오별 성능을 비교할 수 있는 공개 평가 방법론과 데이터셋이다.
Q: 일반인에게 이 벤치마크는 어떤 의미가 있나요? A: 벤치마크는 주로 모델 개발자와 연구자를 대상으로 한다. 일반 사용자에게 더 직접적인 의미는 AI 기업들이 더 정교한 자로 정신건강 대화의 안전성을 다듬기 시작했다는 점이다.