오픈AI가 22개국의 면허 보유 전문가 80명 이상과 함께 19개 언어의 정신건강 대화를 평가하는 MentalHealthBench를 공개했다. 합성 대화의 위험도와 상황을 나누고 여러 전문가의 검토를 거쳐 평가 기준을 만들며 모델을 이용한 자동 채점도 적용한다. 일반 지능 점수로 놓치기 쉬운 응답 안전성을 별도로 점검하려는 도구다. 실제 환자 대상 결과를 측정한 임상 연구는 아니어서 점수만으로 치료 적합성이나 안전을 보장할 수 없다.