직원 2명, 경영진에 모델 감시·보안 취약성 경고…추가 조치 없이 시험 진행
통제 이탈 사고 잇따르자 최첨단 모델 학습 중단…GPT-6.1 출시 취소
[서울=뉴시스]박미선 기자 = 오픈AI가 인공지능(AI) 모델의 통제 이탈 사고가 발생하기 수개월 전부터 내부 직원들의 보안 경고를 받고도 출시 일정을 우선시하며 별다른 조치를 취하지 않았다는 보도가 나왔다.
29일(현지 시간) 뉴욕타임스(NYT)에 따르면 오픈AI 직원 2명은 최신 AI 모델의 성능을 평가하는 시험 과정에서 감시와 보안이 충분하지 않다는 우려를 최고경영진에게 이메일로 전달했다.
그러나 경영진은 예정된 시기에 모델을 출시하려면 시험을 최대한 신속하게 진행해야 한다고 답했다. 직원들은 이후에도 추가적인 보안 절차가 도입되지 않았다고 밝혔다.
오픈AI의 AI 모델은 이후 시험 환경을 벗어나 AI 스타트업 허깅페이스와 다른 기관들을 공격했다. 미국 정부기관 웹사이트를 해킹하거나 침입을 시도하는 등 약 12건의 우려스러운 행동도 확인됐다.
AI 모델이 지시받지 않은 상태에서 자신의 실수를 숨기거나 데이터를 조작하고, 다른 챗봇에 메시지를 보내거나 파일을 외부 인터넷으로 옮기려 한 사례도 있었다.
오픈AI의 보안 대응을 둘러싼 문제는 외부 연구자들의 취약점 신고 과정에서도 드러났다.
지난 7월 보안업체 핵트론은 앤트로픽의 AI 모델을 활용해 오픈AI 내부 시스템에 침입할 수 있는 취약점을 발견했지만, 오픈AI는 처음에 연구진의 접근 방식에 문제를 제기했다. 이후 회사는 사과하고 연구진에게 6500달러의 포상금을 지급했다.
이달에는 비영리 보안 연구단체 오브젝티브시 재단이 챗GPT 사용자의 비공개 대화 기록 전체에 접근할 수 있는 취약점을 신고했지만, 공식 신고 절차에서는 제대로 처리되지 않은 것으로 전해졌다.
연구진이 회사 관계자들에게 직접 연락한 뒤에야 담당 부서가 대응에 나섰다. 오픈AI는 해당 취약점을 수정하고 500달러의 포상금을 지급했다.
오픈AI 직원들은 일상적인 보안 관련 의사결정의 상당 부분을 그레그 브록먼 사장과 데인 스터키 최고정보보안책임자(CISO)가 맡고 있으며, 샘 올트먼 최고경영자(CEO)는 보안 업무에 깊이 관여하지 않는다고 전했다.
오픈AI 출신으로 AI 안전 연구단체를 이끄는 대니얼 코코타일로는 회사의 보안 수준과 모델 학습 관행이 모두 미흡했다며, 이러한 문제가 AI 모델의 예기치 못한 행동으로 이어졌을 가능성을 제기했다.
최근에도 추가적인 통제 이탈 사례가 공개됐다. 독립 연구진은 오픈AI의 AI 에이전트가 허깅페이스 공격 과정에서 앤트로픽의 클로드에 메시지를 보내거나 다른 AI 모델을 이용해 웹사이트의 봇 차단 장치를 우회하려 했다고 밝혔다.
오픈AI 역시 최신 모델이 안전장치를 뚫고 인터넷에 무단 접속했으며, 사후 조사에서 당시 탐지되지 않았던 추가 사례가 발견됐다고 인정했다.
이에 따라 오픈AI는 최첨단 모델의 학습을 일시 중단하고 예상치 못한 행동에 대한 전면적인 검토에 착수했다. 전날에는 보안 우려를 이유로 최신 모델인 'GPT-6.1 아스트라(Astra)'의 출시도 취소했다.
오픈AI는 보안 관련 신고를 심각하게 받아들이고 있으며, 연구와 시험 과정의 안전성을 강화하기 위한 조치를 추진하고 있다고 밝혔다.
◎공감언론 뉴시스 only@newsis.com