오픈AI가 22개국의 면허 보유 전문가 80명 이상과 함께 19개 언어의 정신건강 대화를 평가하는 MentalHealthBench를 공개했다. 합성 대화의 위험도와 상황을 나누고 여러 전문가의 검토를 거쳐 평가 기준을 만들며 모델을 이용한 자동 채점도 적용한다. 일반 지능 점수로 놓치기 쉬운 응답 안전성을 별도로 점검하려는 도구다. 실제 환자 대상 결과를 측정한 임상 연구는 아니어서 점수만으로 치료 적합성이나 안전을 보장할 수 없다.
Tech로 돌아가기
Tech
오픈AI, 정신건강 대화 평가 MentalHealthBench 공개
합성 대화의 안전성 점수는 실제 치료 효과나 임상적 유효성을 증명하지 않습니다.