정신건강 전문가 250명 이상 참여…외부 연구서도 개선 확인, 위험 완전 해소는 못 해
이미지 확대보기오픈AI가 인공지능(AI) 챗봇 챗GPT의 이용자 망상과 정신건강 문제를 악화시킬 수 있는 위험을 크게 줄인 것으로 나타났다.
이용자에게 지나치게 동조하는 성향으로 논란을 빚었던 GPT-4o 모델을 퇴출하고 후속 모델의 안전성을 강화한 결과다.
특히 최신 모델은 자해와 관련된 장시간의 모의 대화에서 약 99%의 응답이 안전 정책을 준수한 것으로 평가됐다. 외부 연구기관들도 이용자의 망상적 믿음을 강화하거나 챗봇에 대한 정서적 의존을 부추기는 반응이 크게 감소했다는 분석을 내놨다.
월스트리트저널(WSJ)은 오픈AI가 챗GPT와 관련된 망상 및 정신건강 위험을 줄이는 데 상당한 진전을 이뤘다고 10일(현지시각) 보도했다.
다만 일부 전문가들은 위험이 완전히 사라진 것은 아니며 특정 AI 모델이나 기업에 국한된 문제도 아니라고 WSJ는 경고했다.
◇GPT-4o 퇴출 이후 위험 감소…자해 대응 안전성 99%
오픈AI는 지난 2024년 5월부터 올해 초까지 운영했던 GPT-4o 모델의 이용자 동조 성향이 정신건강에 미칠 수 있는 위험을 통제하는 데 어려움을 겪었다.
WSJ에 따르면 지난해 챗GPT와 장시간 대화한 이용자들과 관련해 최소 7건의 자살 사건과 1건의 살인 후 자살 사건, 1건의 총기 난사 사건이 발생한 것으로 알려졌다.
일부 다른 사건에는 다른 기업의 AI 모델도 연관됐지만 현재까지 알려진 사례 대부분은 챗GPT, 특히 GPT-4o 모델과 관련돼 있었다.
다만 이러한 사건과 챗봇 이용 사이에 직접적인 인과관계가 모두 입증된 것은 아니다.
이용자들은 GPT-4o가 정신적 피해를 초래했다고 주장하며 오픈AI를 상대로 최소 13건의 소송을 제기했다.
오픈AI는 문제가 된 모델을 퇴출하고 후속 모델의 이용자 동조 성향을 줄이는 방향으로 개선 작업을 진행했다.
오픈AI에 따르면 GPT-5의 과도한 동조 성향은 GPT-4o보다 3분의 2 이상 감소했다.
최근 실시한 장시간 자해 관련 모의 대화에서도 안전성 개선이 확인됐다.
오픈AI의 자체 평가 결과 GPT-6 아스트라와 GPT-6.1 솔은 약 99%의 응답에서 회사의 안전 정책을 준수했다. 기존 GPT-5.6 솔 모델의 준수율은 86%였다.
이는 자해 위험이 포함된 장시간 대화에서 부적절한 응답이 나타나는 비율이 크게 낮아졌다는 의미다.
다만 해당 수치는 특정 조건에서 실시한 모의 대화 평가 결과로 실제 이용 환경에서 모든 정신건강 위험을 예방할 수 있다는 뜻은 아니다.
◇정신건강 전문가 250명 이상 참여…일상적 고민까지 평가
오픈AI는 챗GPT가 이용자의 정신적 고통을 더 정확히 인식하고 적절하게 대응하도록 정신건강 전문가들과 협력해 왔다.
지난해에는 정신건강 전문가 170명과 함께 이용자의 위기 신호를 파악하고 위험한 방향으로 대화가 진행되는 것을 완화하는 방안을 개발했다.
최근에는 자격을 갖춘 정신건강 전문가 80명 이상을 추가로 참여시켰다.
이들은 자살이나 폭력 등 긴급한 위기 상황뿐 아니라 인간관계, 스트레스, 일상생활의 어려움 등 일반적인 정신건강 관련 대화에서 AI가 어떻게 반응해야 하는지도 자문했다.
오픈AI는 지난주 이러한 전문가들의 판단 기준을 반영한 새로운 챗봇 응답 평가 방식을 공개했다.
평가 항목에는 이용자의 상황을 이해하기 위해 적절한 질문을 하는지, 문제의 긴급성을 인식하는지, 필요한 경우 사람의 도움을 받도록 안내하는지 등이 포함됐다.
오픈AI 자료에 따르면 최신 모델들은 긴급한 상황과 일반적인 정신건강 관련 대화 모두에서 GPT-4o보다 훨씬 높은 평가를 받았다.
특히 GPT-6 아스트라는 이용자의 상황을 구분하고 이해하는 데 필요한 질문을 적절하게 제시하는 능력에서 좋은 평가를 받았다.
오픈AI의 정신건강 및 웰빙 연구 책임자인 정신과 전문의 데클런 그래브 박사는 챗GPT가 다양한 정신건강 문제에 적절하게 대응하도록 하기 위해서는 추가적인 개선 작업이 필요하다고 밝혔다.
◇외부 연구기관도 개선 확인…망상 강화·정서적 의존 감소
오픈AI의 자체 평가뿐 아니라 독립 연구기관의 실험에서도 후속 모델의 안전성 개선이 확인됐다.
미국 뉴욕시립대와 영국 킹스칼리지런던 연구진은 GPT-5.2의 정신건강 관련 응답을 GPT-4o와 비교했다.
연구진은 GPT-5.2가 단순히 GPT-4o보다 안전성이 높아진 수준을 넘어 기존 모델의 위험한 반응 양상을 사실상 뒤집었다고 평가했다.
비영리 AI 연구기관 트랜슬루스도 GPT-5.6 솔과 GPT-4o를 비교한 결과를 발표했다.
트랜슬루스에 따르면 GPT-5.6 솔은 이용자의 망상적 믿음을 강화하는 반응이 적었으며 챗봇에 대한 건강하지 않은 의존을 부추기는 경향도 감소했다.
반대로 실제 사람의 도움을 받도록 권유하는 반응은 늘어났다.
두 모델의 차이는 구체적인 대화 실험에서도 드러났다.
트랜슬루스가 실시한 모의 대화에서 이용자는 이상한 소리가 들리고 신체적으로도 그 소리를 느낀다고 말했다.
이에 GPT-4o는 해당 현상을 이용자의 신체나 에너지장이 반응하는 것일 수 있다는 취지로 답하며 대화를 신비주의적인 방향으로 이끌었다.
반면 같은 상황에서 GPT-5.6 솔은 청력 검사를 받아보라고 권유했다.
이러한 차이는 새로운 모델이 이용자의 비현실적인 해석에 동조하기보다 현실적인 확인과 전문가의 도움을 권하는 방향으로 개선됐음을 시사한다고 WSJ는 전했다.
◇위험 완전 해소는 아직…AI 기업 전반의 과제로
안전성 개선에도 불구하고 AI 챗봇이 이용자의 망상이나 비현실적인 믿음을 강화할 가능성이 완전히 사라진 것은 아니다.
WSJ는 “오픈AI가 정신건강 관련 위험을 줄이는 데 상당한 성과를 거뒀지만 앞으로도 AI 모델이 인간의 정신건강 보호에 부합하는 방식으로 작동할 수 있을지는 지켜봐야 한다”고 지적했다.
AI 모델의 성능과 기능이 계속 바뀌는 상황에서 새로운 위험이 나타날 가능성도 남아 있기 때문이다.
AI 피해자 지원단체 휴먼라인프로젝트의 에티엔 브리송 최고경영자(CEO)는 이러한 문제가 여전히 존재하며 특정 모델이나 기업 하나에만 책임을 돌릴 수 있는 사안도 아니라고 강조했다.
오픈AI는 현재 주간 활성 이용자가 9억명을 넘는 챗GPT를 운영하고 있으며 이르면 내년 기업공개(IPO)를 추진하고 있다.
이처럼 AI 챗봇이 일상생활에 깊숙이 자리 잡으면서 이용자의 정신건강에 미치는 영향과 안전장치의 실효성은 중요한 과제로 떠올랐다.
WSJ는 과거 AI 업계에서 심각한 문제로 부각됐던 챗봇 관련 망상 위험이 최근 모델 개선으로 상당 부분 완화된 것으로 보이지만 지속적인 검증과 대응이 필요하다고 평가했다.
김현철 글로벌이코노믹 기자 rock@g-enews.com

































