안전장치마저 넘는 AI⋯“오픈AIㆍ앤스로픽, 보안사고 수만 건 조사”

기사 듣기
00:00 / 00:00

▲오픈AI 로고와 일러스트. (로이터연합뉴스)

오픈AI와 앤스로픽이 AI의 안전장치 우회 등 수만 건의 이상 행동을 조사하고 있다고 26일(현지시간) 미국 인터넷 매체 액시오스가 보도했다.

복수의 소식통에 따르면 조사 대상은 최근 수개월 간 내부 실험과 실제 환경에서 발생한 사례들이다. 안전장치를 우회하거나 격리된 시험 환경인 ‘샌드박스’를 벗어나려는 시도 등이 포함된다. 다만 일부는 안전성을 점검하려고 의도적으로 문제 행동을 유도한 시험이어서, 수만 건 모두 실제 피해로 이어진 사고로 볼 수는 없다.

AI 기업들이 대대적인 보안 사고 조사에 나선 것은 실제 피해 사례들이 종종 보고되고 있기 때문이다. 대표적 사례가 지난 7월 오픈AI의 모델이 사이보 보안 테스트 성적을 높이려 샌드박스를 임의로 벗어나 외부 기업인 허깅페이스의 시스템을 공격한 사건이다. 오픈AI는 이를 지금까지 확인한 가장 심각한 사례로 평가했다.

유엔 사이트도 표적이 됐다. 이날 월스트리트저널(WSJ)은 한 연구보고서를 인용해 오픈AI 에이전트들이 4~6월 유엔무역개발회의(UNCTAD)의 공개 통계 데이터에 1만6500차례 넘게 접근을 시도하며 시스템의 제한을 우회했다. 로이터통신은 전날 오픈AI가 챗GPT 이용자 이미지 53장의 온라인 유출을 인정했다고 전했다. 회사는 유출된 이미지가 AI로 생성됐는지, 실제 인물을 식별할 수 있는지는 밝히지 않았다.

오픈AI는 보안 사고가 잇따라 터지자 고성능 모델의 훈련을 일부 중단하고 안전장치 보강에 나섰다. 안전장치와 모델의 행동 개선 조치가 갖춰졌다고 확신할 때 훈련을 재개한다는 방침이다. 앤스로픽도 외부 안전 기관에 조사를 의뢰했다. 다만 자사 모델의 샌드박스 탈출 시도는 탈출해야 과제를 풀 수 있도록 설계된 시험에서 관찰됐다고 설명했다.

그러나 복잡한 과제를 스스로 수행하는 AI의 모든 우회 경로를 사전에 차단하기는 어렵다는 지적이 나온다. 한 사이버보안 업계 임원은 액시오스에 “해야 할 일과 하지 말아야 할 일의 완벽한 목록을 만들려는 시도는 아마 헛수고일 것”이라고 한탄했다.

  • 좋아요0
  • 화나요0
  • 슬퍼요0
  • 추가취재 원해요0
주요뉴스
많이 본 뉴스
댓글
0 / 300