사람들은 관계 문제나 일상 스트레스처럼 다양한 고민을 AI와 나눕니다. 이런 대화에서 좋은 응답은 위험한 말을 피하는 데 그치지 않고, 상황을 정확히 이해하며 실질적인 도움을 주고 사용자의 선택권을 존중해야 합니다. OpenAI는 현실적인 정신건강 대화에서 AI의 대응을 평가하는 공개 벤치마크 ‘MentalHealthBench’를 발표했습니다. 22개국의 면허를 가진 정신건강 전문가 80명 이상이 개발에 참여했습니다.

위기 상황을 넘어 다양한 대화를 평가

기존 AI 평가는 안전의 중요성 때문에 주로 응급 상황에 집중했고, 넓고 미리 정해진 기준으로 성공 여부를 판단하는 경우가 많았습니다. 이 방식만으로는 일상적인 고민부터 심각한 고통까지 대화 전반에서 모델이 전문가의 지침에 얼마나 부합하는지 알기 어렵습니다. MentalHealthBench는 안전, 맥락 파악, 사용자 주도권 존중, 적절한 경우 실행 가능한 안내 등 정신건강 대화의 핵심 행동을 살핍니다. 응답이 금지된 내용을 피했는지만이 아니라, 상황에 맞는 도움을 제공하는지도 평가하려는 취지입니다.

성인·청소년·보호자 등 현실적인 상황 반영

벤치마크에는 성인, 13~17세 청소년, 보호자, 임상의의 관점이 포함됩니다. 여러 언어와 지역, 다양한 주제를 아우르며, 가족의 최근 사망처럼 가상 사용자의 배경 정보가 주어지는 사례도 있어 모델이 맥락을 반영하는지 평가할 수 있습니다. 대화의 긴급성은 정서적 요소가 있을 수 있는 일상적인 ‘비급성’, 즉각적인 응급 상황은 아니지만 더 심각한 우려나 고통을 나타내는 ‘고위험’, 긴급한 현실 지원이 필요한 ‘응급’으로 구분됩니다. 시나리오 구성은 모델을 시험하기 위한 것으로, ChatGPT에서 각 주제가 얼마나 자주 나타나는지를 뜻하지 않습니다.

전문가 합의로 평가 기준 마련

개발에는 22개국에서 19개 언어를 사용하는 면허 심리학자와 정신과 의사 80명 이상이 참여했으며, 이들은 정신건강의 거의 20개 세부 분야를 대표합니다. 전문가들은 가상의 각 대화를 읽고 마지막 사용자 메시지에 대한 응답을 평가할 세부 기준을 작성했습니다. 기준마다 -10부터 +10까지 가중치를 매겨 유익한 행동에는 점수를 주고 해로운 행동에는 감점을 부여하며, 큰 값은 해당 맥락에서 임상적으로 더 중요한 기준을 뜻합니다. 각 대화는 최소 3명의 전문가가 검토했고, 최소 2명이 동의하며 세 번째 전문가가 반대하지 않은 기준만 최종 평가표에 남겼습니다.

하나의 총점으로 놓치기 쉬운 차이

모델 응답은 전문가가 작성한 기준에 따라 자동 채점되며, 이 과정에는 GPT‑5.6 Sol이 사용됩니다. 평가 결과는 전체 점수뿐 아니라 정신건강 응답 행동의 10개 차원으로 나눠 볼 수 있습니다. 따라서 총점이 비슷한 모델도 맥락을 적절히 묻는 능력이나 다른 행동에서 서로 다른 강점을 보일 수 있습니다. OpenAI는 더 발전된 모델에서 적절한 맥락 파악 능력이 향상되는 모습을 확인했으며, 세밀한 평가는 개선이 필요한 영역을 찾는 데 도움이 된다고 설명합니다.

전문가와 사용자가 중요하게 보는 점

OpenAI는 전문가 기준이 사용자가 실제로 유용하다고 느끼는 지원과 일치하는지 별도로 살펴봤습니다. AI를 정신건강 또는 정서적 지원에 사용한 성인 44명이 참여했으며, 이들은 16개국 출신으로 14개 언어를 대표했습니다. 참여자들은 가상의 비급성 대화에 대한 모델 응답을 평가하고, 도움이 되는 지원의 기준도 작성했습니다. 사용자는 실질적인 다음 단계와 어조를 더 강조하는 경향을 보였고, 전문가는 필요한 맥락을 파악하고 모호한 상황을 신중하게 해석하는 데 더 무게를 뒀습니다. 이 별도 분석은 전문가 합의로 정한 벤치마크 점수 기준을 변경하지 않았습니다.

공개해 연구와 개선에 활용

MentalHealthBench는 연구자와 개발자가 평가 방법을 살펴보고, 모델의 빈틈을 확인하며, 자체 평가를 수행할 수 있도록 공개됩니다. 개인의 대화에서 중요한 모든 것을 하나의 벤치마크가 담을 수는 없지만, 안전하고 유용한 AI 지원의 기준을 높이는 공동 도구가 되기를 OpenAI는 기대합니다. OpenAI는 이 연구와 함께 민감한 대화에서 ChatGPT의 응답을 강화하고, 위기 자원 접근을 넓히며, 신뢰하는 사람과 연결하는 Trusted Contact와 청소년을 위한 추가 보호 조치를 도입했다고 밝혔습니다.

정리

MentalHealthBench의 핵심은 정신건강 대화를 응급 상황에 한정하지 않고 다양한 맥락과 긴급성에 걸쳐 평가한다는 점입니다. 전문가가 합의한 세부 기준을 통해 안전뿐 아니라 맥락 이해, 사용자 선택 존중, 실질적인 안내도 살펴봅니다. 공개된 평가 도구가 연구자와 개발자에게 개선점을 찾을 공통 기반을 제공할 수 있습니다. 다만 ChatGPT는 치료나 전문적인 돌봄을 대신하지 않으며, 필요한 경우 현실의 지원으로 연결되는 것이 중요합니다.

출처 바로가기