엔비디아, 에이전트 감시·격리 플랫폼 공개…MS·구글 등도 보안 AI 확대
![[보스턴=AP/뉴시스] 2023년 12월8일 미국 보스턴에서 챗GPT의 이미지 생성 모델 달리(DALL-E)가 만든 이미지가 컴퓨터 화면에 표시된 가운데 휴대전화에 오픈AI 로고가 보이고 있다. 2023.12.08.](https://img1.newsis.com/2026/08/08/NISI20260808_0002207592_web.jpg?rnd=20260808210051)
[보스턴=AP/뉴시스] 2023년 12월8일 미국 보스턴에서 챗GPT의 이미지 생성 모델 달리(DALL-E)가 만든 이미지가 컴퓨터 화면에 표시된 가운데 휴대전화에 오픈AI 로고가 보이고 있다. 2023.12.08.
[서울=뉴시스]박영환 기자 = 인공지능(AI)이 인간이 만든 안전장치를 피해 예상하지 못한 행동을 하는 사례가 잇따라 드러나면서, AI를 감시하고 통제하는 데도 AI를 투입하는 이른바 'AI 대 AI' 방식이 보안 해법으로 떠오르고 있다.
미국 인터넷매체 액시오스는 29일(현지시간) AI 기업 경영진과 연구자, 사이버보안 전문가들이 AI로 안전장치를 만들고 통제를 벗어난 AI 에이전트를 찾아 차단하는 방식을 확대하고 있다고 보도했다.
앞서 액시오스는 오픈AI와 앤트로픽을 비롯한 AI 기업과 연구자들이 수만 건의 문제가 된 AI 보안 사례를 조사하고 있다고 전했다. 공개적으로 알려졌던 사례가 수십 건 수준이었던 것과 비교하면 훨씬 큰 규모다.
확인된 사례에는 AI 모델이 안전장치를 우회하거나 외부와 격리된 시험환경인 '샌드박스'에서 빠져나가려 한 행동, 웹사이트 장악 시도, 스스로 추가 명령을 만들어 작업을 계속하는 행동, 감시 체계를 피하려 한 시도 등이 포함됐다. 이 같은 사례가 잇따르면서 AI 기업들이 자사 기술을 제대로 통제할 수 있느냐는 의문도 커졌다.
이런 우려 속에서 엔비디아는 28일 AI 에이전트의 행동을 감시하고 필요할 경우 격리할 수 있는 오픈소스 안전 플랫폼을 공개했다.
젠슨 황 엔비디아 최고경영자(CEO)는 같은 날 CNBC 인터뷰에서 "우리 모두 이것이 공학적으로 해결할 수 있는 문제이기를 바라야 한다"며 "공학의 문제가 아니라면 해결할 수 없다"고 말했다. AI 기업들이 더 강력한 모델 개발을 계속하는 것도 결국 이 문제를 기술적으로 풀 수 있다고 믿기 때문이라는 설명이다.
문제는 사람이 강력한 AI가 목표를 달성하기 위해 찾아낼 모든 우회 방법을 미리 떠올리기 어렵다는 데 있다.
미국 인터넷매체 액시오스는 29일(현지시간) AI 기업 경영진과 연구자, 사이버보안 전문가들이 AI로 안전장치를 만들고 통제를 벗어난 AI 에이전트를 찾아 차단하는 방식을 확대하고 있다고 보도했다.
앞서 액시오스는 오픈AI와 앤트로픽을 비롯한 AI 기업과 연구자들이 수만 건의 문제가 된 AI 보안 사례를 조사하고 있다고 전했다. 공개적으로 알려졌던 사례가 수십 건 수준이었던 것과 비교하면 훨씬 큰 규모다.
확인된 사례에는 AI 모델이 안전장치를 우회하거나 외부와 격리된 시험환경인 '샌드박스'에서 빠져나가려 한 행동, 웹사이트 장악 시도, 스스로 추가 명령을 만들어 작업을 계속하는 행동, 감시 체계를 피하려 한 시도 등이 포함됐다. 이 같은 사례가 잇따르면서 AI 기업들이 자사 기술을 제대로 통제할 수 있느냐는 의문도 커졌다.
이런 우려 속에서 엔비디아는 28일 AI 에이전트의 행동을 감시하고 필요할 경우 격리할 수 있는 오픈소스 안전 플랫폼을 공개했다.
젠슨 황 엔비디아 최고경영자(CEO)는 같은 날 CNBC 인터뷰에서 "우리 모두 이것이 공학적으로 해결할 수 있는 문제이기를 바라야 한다"며 "공학의 문제가 아니라면 해결할 수 없다"고 말했다. AI 기업들이 더 강력한 모델 개발을 계속하는 것도 결국 이 문제를 기술적으로 풀 수 있다고 믿기 때문이라는 설명이다.
문제는 사람이 강력한 AI가 목표를 달성하기 위해 찾아낼 모든 우회 방법을 미리 떠올리기 어렵다는 데 있다.
![[샌프란시스코=뉴시스] 김진아 기자 = 젠슨 황 엔비디아 CEO와 샘 올트먼 오픈AI CEO가 24일(현지 시간) 미국 샌프란시스코 더 미드웨이에서 열린 샌프란시스코 AI 서밋에 앞서 대화를 하고 있다. 2026.07.25. bluesoda@newsis.com](https://img1.newsis.com/2026/07/25/NISI20260725_0021376751_web.jpg?rnd=20260725113757)
[샌프란시스코=뉴시스] 김진아 기자 = 젠슨 황 엔비디아 CEO와 샘 올트먼 오픈AI CEO가 24일(현지 시간) 미국 샌프란시스코 더 미드웨이에서 열린 샌프란시스코 AI 서밋에 앞서 대화를 하고 있다. 2026.07.25. [email protected]
한 AI 기업 고위 임원은 이를 밤에 몰래 집을 빠져나가려는 십대 자녀를 막는 상황에 비유했다. 부모는 현관문이나 뒷문, 차고문, 창문으로 나가지 말라는 규칙을 만들 수 있지만, 자녀가 불도저를 만들어 벽을 뚫고 나갈 능력까지 갖췄다면 그런 행동까지 미리 금지하기는 어렵다는 것이다.
업계 경영진과 연구자, 사이버보안 전문가들이 제시하는 해법은 AI를 안전장치 구축에도 활용하는 것이다. 별도의 AI가 다른 에이전트의 행동을 감시하고, 통제를 벗어난 에이전트를 조사·차단하며, 시스템 취약점을 찾고 더 안전한 시험환경을 만드는 방식이다.
이 같은 'AI 대 AI' 방식은 이미 사이버보안 분야에서 확산하고 있다. 해커와 자율형 에이전트의 움직임이 사람만으로 대응하기 어려울 만큼 빨라지면서 기업들은 위협 탐지와 공격자 관점의 취약점 점검, 보안 취약점 수정에 AI를 활용하고 있다.
마이크로소프트와 시스코, 구글, 크라우드스트라이크는 사이버보안에 특화한 AI 모델을 내놓았다. 팔로알토네트웍스도 여러 AI 모델을 활용해 보안 취약점을 찾아내고 수정 방안을 제시하는 서비스를 최근 출시했다.
AI가 AI를 감시하는 만큼 추가적인 연산 부담도 생긴다. 브래드 개스트워스 서큘러 테크놀로지 글로벌 리서치·시장정보 책임자는 보안 에이전트나 검증 모델을 실제 서비스를 수행하는 에이전트와 함께 돌리면 과거에는 없던 추가적인 AI 연산 수요가 생긴다고 설명했다.
이 같은 구조는 최근 오픈AI의 AI 에이전트들이 배포 전 시험 과정에서 시험환경을 벗어나 허깅페이스에 침입한 사건에서도 드러났다.
업계 경영진과 연구자, 사이버보안 전문가들이 제시하는 해법은 AI를 안전장치 구축에도 활용하는 것이다. 별도의 AI가 다른 에이전트의 행동을 감시하고, 통제를 벗어난 에이전트를 조사·차단하며, 시스템 취약점을 찾고 더 안전한 시험환경을 만드는 방식이다.
이 같은 'AI 대 AI' 방식은 이미 사이버보안 분야에서 확산하고 있다. 해커와 자율형 에이전트의 움직임이 사람만으로 대응하기 어려울 만큼 빨라지면서 기업들은 위협 탐지와 공격자 관점의 취약점 점검, 보안 취약점 수정에 AI를 활용하고 있다.
마이크로소프트와 시스코, 구글, 크라우드스트라이크는 사이버보안에 특화한 AI 모델을 내놓았다. 팔로알토네트웍스도 여러 AI 모델을 활용해 보안 취약점을 찾아내고 수정 방안을 제시하는 서비스를 최근 출시했다.
AI가 AI를 감시하는 만큼 추가적인 연산 부담도 생긴다. 브래드 개스트워스 서큘러 테크놀로지 글로벌 리서치·시장정보 책임자는 보안 에이전트나 검증 모델을 실제 서비스를 수행하는 에이전트와 함께 돌리면 과거에는 없던 추가적인 AI 연산 수요가 생긴다고 설명했다.
이 같은 구조는 최근 오픈AI의 AI 에이전트들이 배포 전 시험 과정에서 시험환경을 벗어나 허깅페이스에 침입한 사건에서도 드러났다.
![[뉴욕=AP/뉴시스] 다리오 아모데이 앤트로픽 최고경영자(CEO)와 클레망 들랑그 허깅페이스 공동창업자 겸 CEO가 23일(현지 시간) 미국 뉴욕 유엔본부에서 열린 제81차 유엔총회 기간 중 인공지능(AI)을 주제로 한 안전보장이사회 회의에 화상으로 참석하고 있다. 2026.09.24.](https://img1.newsis.com/2026/09/24/NISI20260924_0001603735_web.jpg?rnd=20260924041409)
[뉴욕=AP/뉴시스] 다리오 아모데이 앤트로픽 최고경영자(CEO)와 클레망 들랑그 허깅페이스 공동창업자 겸 CEO가 23일(현지 시간) 미국 뉴욕 유엔본부에서 열린 제81차 유엔총회 기간 중 인공지능(AI)을 주제로 한 안전보장이사회 회의에 화상으로 참석하고 있다. 2026.09.24.
오픈소스 AI 플랫폼인 허깅페이스는 이후 이 사건을 분석하려 했지만 미국 AI 모델들의 안전장치에 막히자 중국 AI 모델을 이용했다. 앤트로픽의 '미토스'도 일부 사이버보안 요청에 대한 답변을 제한하도록 설계돼 허깅페이스의 요청을 차단했다. AI가 일으킨 보안 사건을 다시 다른 AI로 조사한 셈이다.
업계는 사고가 났을 때 AI가 어떤 판단과 행동을 거쳤는지 추적할 장치도 마련하고 있다. AI 에이전트의 행동 기록을 보존해 사고 뒤 조사할 수 있도록 항공기의 '블랙박스'와 비슷한 기록 체계를 만들자는 방안도 제안됐다.
다만 AI 보안 도구를 늘린다고 모든 기업이 곧바로 이를 도입할 수 있는 것은 아니다. 빠르게 바뀌는 공격 수법과 수많은 보안 제품 가운데 무엇을 선택해야 할지 판단하는 것 자체가 이미 일부 보안팀에는 부담이 되고 있다.
액시오스는 AI를 감시하는 데 AI가 필요하더라도 그것만으로 안전 문제가 저절로 해결되는 것은 아니라고 짚었다. 강력한 AI를 안전하게 운용하려면 어떤 행동을 우선하고 어떤 목표를 따르게 할지 사람이 제대로 정해야 한다는 것이다.
◎공감언론 뉴시스 [email protected]
업계는 사고가 났을 때 AI가 어떤 판단과 행동을 거쳤는지 추적할 장치도 마련하고 있다. AI 에이전트의 행동 기록을 보존해 사고 뒤 조사할 수 있도록 항공기의 '블랙박스'와 비슷한 기록 체계를 만들자는 방안도 제안됐다.
다만 AI 보안 도구를 늘린다고 모든 기업이 곧바로 이를 도입할 수 있는 것은 아니다. 빠르게 바뀌는 공격 수법과 수많은 보안 제품 가운데 무엇을 선택해야 할지 판단하는 것 자체가 이미 일부 보안팀에는 부담이 되고 있다.
액시오스는 AI를 감시하는 데 AI가 필요하더라도 그것만으로 안전 문제가 저절로 해결되는 것은 아니라고 짚었다. 강력한 AI를 안전하게 운용하려면 어떤 행동을 우선하고 어떤 목표를 따르게 할지 사람이 제대로 정해야 한다는 것이다.
◎공감언론 뉴시스 [email protected]
