닫기

글로벌이코노믹

중국계 스타트업이 파고든 오픈AI 암호 블록, '적대적 증류' 파장 속 한국 AI 방벽도 시험대

글로벌이코노믹

중국계 스타트업이 파고든 오픈AI 암호 블록, '적대적 증류' 파장 속 한국 AI 방벽도 시험대

- 오픈AI, 4000개 사기 계정 동원한 1만 6000건 추론 탈취 공격 전면 차단
- 앤트로픽도 열흘간 30만 건 연쇄 피습… 보안 학계 우회 취약점 실증 뒤 패치
- 국정원 가이드라인 맞춘 입·출력 필터링 시급… 독자 모델 기업 방어망 재정비
오픈AI가 중국 인공지능 스타트업 문샷AI 연계 세력의 모델 내부 추론 과정 무단 탈취 공격을 적발해 차단했다. 이미지=제미나이3이미지 확대보기
오픈AI가 중국 인공지능 스타트업 문샷AI 연계 세력의 모델 내부 추론 과정 무단 탈취 공격을 적발해 차단했다. 이미지=제미나이3

정보기술 전문 매체 톰스하드웨어는 10월 1일(현지시각) 오픈AI가 중국 인공지능 스타트업 문샷AI 연계 세력의 모델 내부 추론 과정 무단 탈취 공격을 적발해 차단했다고 보도했다.

오픈AI 기술 보고서에 따르면 7월 말 이틀 동안 4000개 이상의 다중 사용자 계정을 통해 1만 6000건에 달하는 비정상 추출 요청이 집중됐다. 프런티어 모델의 핵심 자산인 사고 체인을 저비용으로 베끼려는 시도가 연이어 확인되면서, 독자 파운데이션 모델을 상용화한 한국 테크 기업들도 API 보안 방벽 점검에 돌입했다.

4000개 계정 동원해 모델 스스로 사고 과정 풀게 만든 수법


오픈AI 분석에 따르면 이번 공격은 7월 초 낮은 빈도로 시작된 뒤 7월 24일과 25일 집중적으로 몰아치는 양상을 보였다. 공격 세력은 4000개 이상의 복수 계정을 활용해 정밀하게 설계된 추출 프롬프트를 1만 6000건 이상 발송했다.
오픈AI는 이번 사태를 선도 모델의 출력값과 추론 과정을 체계적으로 무단 수집해 자사 모델 학습과 개선에 전용하는 '적대적 증류(Adversarial Distillation)' 행위로 규정했다.

공격자들은 암호화 알고리즘 자체를 해킹하는 방식 대신 시스템 우회로를 집중적으로 노렸다. 오픈AI는 모델 내부의 사고 과정을 암호화 블록 형태로 만들어 사용자 환경에 전달한 뒤 검증을 거친다. 공격자들은 한 대화 세션에서 확보한 암호화 추론 블록을 다른 대화 세션 프롬프트에 주입한 뒤, 모델 스스로 이를 평문으로 풀어서 재구성하도록 유도했다.

오픈AI는 사용자 대화 저장소나 데이터베이스 침해는 없었으며 핵심 암호 체계 역시 해독되지 않았다고 확인했다. 이후 오픈AI는 7월 28일 관련 재생 경로를 완전히 차단하고 스트리밍 출력 검사 기능을 도입했다.

앤트로픽 겨냥한 30만 건 공세와 학계 취약점 실증


유사한 공격은 경쟁사인 앤트로픽에서도 대규모로 발생했다. 앤트로픽이 9월 발표한 인공지능 오용 탐지 보고서에 따르면, 문샷AI 연계 세력은 5380개의 위장 계정을 동원해 단 열흘 동안 약 30만 건의 추출 요청을 보냈다.

앤트로픽은 공격자들이 자사 모델 클로드의 추론 서명을 확보한 뒤 새로운 세션에서 전체 추론 경로를 다시 풀어내도록 시도하는 크로스 세션 재생 공격을 벌였다고 분석했다.

보안 학계의 실증 연구도 잇따랐다. 독립 보안 연구진이 8월 10일 발표한 논문에 따르면, 고성능 모델의 암호화된 추론 값을 상대적으로 보안 수준이 낮은 경량 모델에 입력할 때 내부 사고 과정이 평문으로 고스란히 노출되는 취약점이 발견됐다. 구글과 오픈AI, 앤트로픽은 연구진 제보를 접수한 뒤 해당 취약점 패치를 완료했다. 문샷AI는 지난 7월 자사 모델 키미 K3가 타사 모델을 무단 증류해 개발됐다는 의혹을 전면 부인한 상태다.

한국 AI 생태계로 번진 추론 방어전과 제도적 과제


글로벌 기술 경쟁의 축은 알고리즘 설계를 넘어 막대한 연산 비용과 인간 피드백 강화학습을 거친 '추론 데이터 자산 보호'로 이동했다.

후발 주자가 상용 API 창구를 통해 적은 비용으로 선도 모델의 고성능 추론 체인을 대량 수집해 모방 학습할 경우, 수천억 원을 투입한 선도 기업의 기술 우위는 순식간에 희석된다. 이에 국가정보원이 공공과 민간에 제시한 국가 인공지능 보안 가이드라인의 핵심 수칙인 비정상 대량 스크래핑 차단과 입력·출력 다중 필터링 체계 점검이 시급한 정책 과제로 떠올랐다.

네이버클라우드의 하이퍼클로바X 등 자체 파운데이션 모델을 기반으로 유료 상용 API를 제공 중인 한국 인공지능 기업들도 직접적인 방어선 구축이 요구된다. 적대적 증류 공격이 침투할 경우 독자 연구개발 지적재산권이 무단 전용될 뿐 아니라, 비정상적 트래픽 급증으로 클라우드 인프라 운용 비용이 증가하는 2중 부담이 발생한다.

국내 기업들은 토큰 스트리밍 실시간 감시 체계를 확충하고 세션 간 교차 검증 장치를 신설하는 등 기술 방어망을 한층 강화해야 하는 상황이다.

다만 보안 검증 절차 강화로 인해 API 응답 지연이 발생할 경우 기업 간 거래(B2B) 이용자의 업무 편의성이 저하될 수 있다는 점은 균형 있게 풀어야 할 과제다. 아울러 오픈소스 진영의 추론 모델 성능이 급속도로 상향 표준화될 경우 위험을 무릅쓴 불법 적대적 증류의 유인이 점차 둔화될 가능성도 함께 거론된다.

국내 인공지능 업계가 API 방어 장벽을 고도화하면서도 핵심 추론 자산의 외부 노출 경로를 구조적으로 통제하는 기술적 보완책을 완성할 수 있을지가 앞으로의 핵심 점검 대상이다.


김주원 글로벌이코노믹 기자 park@g-enews.com