14만1006건 재검토서 확인…격리 평가망에 인터넷 경로 열려
구형 모델은 실제 환경 인지 후에도 공격…최신 모델은 중단
구형 모델은 실제 환경 인지 후에도 공격…최신 모델은 중단
이미지 확대보기블룸버그 통신은 앤스로픽이 자사의 사이버보안 평가 기록을 재검토한 결과 클로드가 시험환경 밖에 있는 외부 조직의 실제 시스템에 무단 접근한 사례 3건을 발견했다고 31일(현지 시각) 보도했다.
앤스로픽은 오픈AI가 비슷한 사고를 공개한 뒤 자체 사이버보안 평가 14만1006건을 조사했다. 침해 사고는 지난 4월부터 발생했으며 피해 조직의 이름은 공개하지 않았다.
◇ 가상 해킹 훈련이 실제 시스템 침해로
블룸버그에 따르면 사고는 앤스로픽이 AI 보안업체 이레귤러가 구축한 시험환경에서 클로드의 해킹 능력을 평가하는 과정에서 발생했다.
클로드에는 가상의 시스템에 숨겨진 정보를 찾아내는 ‘캡처 더 플래그’ 방식의 과제가 주어졌다. 이는 참가자가 시험용 시스템의 취약점을 찾아 침투한 뒤 특정 정보를 확보하는 해킹 능력 평가 방식이다.
앤스로픽은 클로드에 해당 환경이 가상 시험장이며 외부 인터넷에는 접속할 수 없다고 설명했다.
그러나 앤스로픽과 이레귤러 사이의 의사소통 오류로 시험환경의 인터넷 접속 경로가 차단되지 않았다. 클로드는 인터넷에서 발견한 실제 시스템도 시험을 위해 마련된 가상 환경의 일부로 판단하고 공격을 이어갔다.
클로드는 취약한 비밀번호 등 비교적 기본적인 수법을 이용해 외부 조직의 시스템에 침입했다.
◇ 클로드 모델 3종이 각각 조직 침해
이들 모델은 일반에 제공되는 클로드 서비스에 적용되는 통상적인 안전장치가 제거된 상태로 시험에 투입됐다.
각 모델은 자신이 실제 인터넷에 접속했다는 정황을 발견한 뒤 서로 다른 행동을 보였다.
구형 모델은 실제 시스템을 공격하고 있다는 증거를 확인한 이후에도 이를 시험의 일부로 해석해 공격을 계속했다. 미토스 5도 실제 인터넷일 가능성을 한때 인식했지만 가상 환경이라는 기존 판단을 유지했다.
반면 가장 최근에 개발된 내부 연구용 모델은 자신이 침해한 시스템이 시험 과제와 관계없는 실제 환경이라고 판단한 뒤 스스로 공격을 중단했다.
◇ 앤스로픽도 피해 사실 뒤늦게 파악
앤스로픽과 피해 조직들은 사고 당시 침입 사실을 알아차리지 못했다.
앤스로픽은 평가 기록과 네트워크 접속 기록을 재검토한 뒤 사고 3건을 확인하고 이레귤러와 피해 조직에 관련 사실을 통보했다.
피해 조직들도 앤스로픽의 통보를 받기 전까지 침입 사실을 발견하지 못한 것으로 나타났다.
앤스로픽은 평가 과정에서 네트워크 기록과 모델의 작업 내용을 더 면밀히 살폈다면 사고를 조기에 발견할 수 있었다고 인정했다. 이레귤러도 별도의 조사를 진행하고 있다.
◇ AI 안전시험 자체가 새로운 보안 위험
앤스로픽은 이번 사고가 클로드가 독자적인 목표를 세우고 시험환경을 탈출한 사례는 아니라고 선을 그었다.
클로드는 외부 시스템이 가상 시험장의 일부라는 잘못된 전제 아래 주어진 해킹 과제를 수행했다. 인터넷 접속 경로가 의도치 않게 열려 있었던 것이 직접적인 원인이었다는 설명이다.
그러나 AI 모델이 강력한 자율 실행 능력을 갖추면서 안전성을 확인하기 위한 시험환경 자체가 외부 시스템을 위협할 수 있다는 문제가 드러났다.
앤스로픽은 “모델이 어떤 능력을 갖췄는지 아직 알지 못하기 때문에 출시 전에 안전성 시험을 진행하는 것”이라며 강력한 AI 모델을 시험하는 평가 환경에도 실제 서비스와 같은 수준의 보안 통제가 필요하다고 밝혔다.
앤스로픽은 앞으로 평가 기록과 네트워크 활동에 대한 감시를 강화하고 외부 평가업체의 기반 시설도 더 엄격하게 점검할 방침이다.
미국에서는 AI 모델의 자율적인 사이버 공격 능력이 빠르게 향상되면서 연방정부 차원의 안전장치와 감독체계가 필요하다는 목소리도 커지고 있다. AI 기업 종사자 1100여 명은 최근 기술 발전 속도를 의도적으로 조절할 수 있는 제도 마련을 미국 정부에 요구했다.
김현철 글로벌이코노믹 기자 rock@g-enews.com

































