2019년부터 리브젠 책 GPT 학습에 사용
직원들 "수상한 출처"…공개 자료서 이름 빼기 논의
법무책임자도 무료 다운로드 데이터원으로 추천
월스트리트저널(WSJ)은 19일(현지시간) 지난 17일 공개된 법원 서류를 인용해 이같이 보도했다. 존 그리샴, 데이비드 발다치, 조디 피코, 조너선 프랜즌 등 작가들은 3년 전 오픈AI와 마이크로소프트를 저작권 침해 혐의로 제소했으며, 이번 자료를 근거로 본안 재판에 앞서 자신들의 손을 들어달라고 연방법원에 요청하고 있다.
오픈AI와 마이크로소프트는 저작물을 허락 없이 제한적으로 사용할 수 있는 미국 저작권법상의 '공정 이용'(fair use)에 해당한다고 맞서고 있다. 기존 저작물을 그대로 제공한 것이 아니라 AI 모델을 훈련하는 데 사용한 만큼 결과적으로 새로운 용도로 변형됐다는 주장이다.
법원에 따르면 오픈AI는 2019년부터 대규모언어모델(LLM)을 훈련시키기 위해 리브젠의 책을 사용하기 시작했다. 리브젠은 책과 학술논문을 무료로 제공해온 사이트로, 저작권 자료를 불법 복제했다는 지적을 받아왔다. 미국 연방법원은 2015년 리브젠의 폐쇄를 명령했고 출판사 엘스비어는 2017년 리브젠을 상대로 1500만달러의 배상 판결을 받아냈다.
특히 당시 오픈AI의 법무책임자였던 데이비드 랜스키도 리브젠에서 책을 무료로 내려받는 방안을 학습 데이터 확보 방법 가운데 하나로 추천했다고 작가 측이 제출한 서류는 공개했다.
당시 GPT-3 개발을 이끌던 톰 브라운과 기술진 벤 만은 내부 메시지에서 리브젠을 상당히 '수상한(sketchy)' 출처로 표현했다. 현재 경쟁사 앤트로픽 최고경영자(CEO)인 다리오 아모데이 당시 오픈AI 선임연구원도 내부 슬랙에서 실제 데이터가 리브젠에서 왔는데 이를 'Books1'과 'Books2'라고만 부르고 출처를 밝히지 않는 것이 문제가 되지 않겠느냐는 취지로 물었다.
공개될 가능성이 있는 논문에서 리브젠에 대한 언급을 빼는 방안도 직원들 사이에서 논의된 것으로 전해졌다. 벤 만은 한 데이터세트 설명에 대해 "리브젠이기 때문에 일부러 모호하게 썼다"는 취지의 메시지를 남겼다.
초기 모델 훈련에 참여했던 인사 가운데 상당수는 이후 앤트로픽으로 옮겼다. 오픈AI는 리브젠을 이용해 초기 모델을 만든 직원들은 현재 회사에 남아 있지 않으며, 해당 데이터세트도 현재의 챗GPT 모델을 구동하는 데 사용되지 않는다고 밝혔다. 앤트로픽은 WSJ의 논평 요청에 응하지 않았다.
오픈AI 내부에서는 책을 정식으로 대량 구매하는 방안도 여러 차례 검토됐다. 그레그 브록먼 오픈AI 사장은 2022년 말 공동창업자 일리야 수츠케버에게 보낸 메시지에서 많은 책을 구입할 수는 있지만 "토큰당 비용이 비싸 우선순위를 두지 않았다"고 썼다. 토큰은 AI가 글을 처리하는 기본 단위다.
바룬 셰티 오픈AI 미디어 파트너십 담당 부사장은 이번 소송에서 회사가 책을 대규모로 사들여 스캔한 뒤 학습에 활용한 사례에 대해서는 알지 못한다고 증언했다.
오픈AI는 이후 리브젠 데이터 자체를 없애기로 했다. 당시 연구담당 부사장이던 밥 맥그루는 2022년 6월 내부 슬랙에서 회사가 언론의 주목을 많이 받는 상황인 만큼 "지금이 리브젠을 시스템과 저장소에서 제거할 적기"라고 썼다.
맥그루 전 부사장은 리브젠을 삭제하면 연구진이 과거 GPT-3나 GPT-3.5의 연구 결과를 그대로 재현하기 어려워질 수 있다고 지적하면서도, 데이터를 없애는 것이 "법적 이유로 매우 가치가 있을 것"이라고 덧붙였다. 오픈AI는 이후 해당 데이터세트를 내부 자료에서 삭제했다.
내부 자료에는 AI가 작가들의 일자리를 위협할 수 있다는 우려도 담겼다. 잭 클라크 당시 오픈AI 정책책임자는 2020년 GPT 모델의 성능이 좋아질수록 장르소설 작가들이 아마존에서 AI에 의해 대체될 가능성을 우려하게 될 것이라고 경고했다. 그는 예술가들이 문제를 제기하더라도 회사가 이를 무시하고 모델을 공개하게 될 가능성도 언급했다.
현재 앤트로픽 공동창업자인 클라크 전 책임자는 오픈AI의 연구가 사람들을 실직하게 만들 수 있다는 점도 인정했다. 기술진이었던 타룬 고기네니도 2022년 12월 소셜미디어에 AI가 예술가들의 경쟁을 늘려 일자리를 빼앗을 수 있다는 불만을 알고 있다면서 이를 "감수할 수 있는 경제적 혼란"으로 본다는 취지의 글을 올렸다. 반면 샘 올트먼 오픈AI CEO는 2023년 미 의회에서 회사는 "창작자를 대체하기를 원하지 않는다"고 증언했다.
생성형 AI 학습에 저작권 자료를 사용한 것이 공정 이용에 해당하는지를 둘러싼 소송은 다른 작가들과 교과서 저자들 사이에서도 이어지고 있다. 앤트로픽은 지난해 자사 AI 훈련에 불법복제 작품이 사용됐다고 주장한 작가들과 최소 15억달러를 지급하기로 합의했다. 당시 법원은 일정한 조건에서는 책을 AI 학습에 사용하는 것이 공정 이용에 해당할 수 있지만, 불법복제 전자책 사이트에서 확보한 수백만권에까지 그 논리가 적용되는 것은 아니라고 판단했다.
◎공감언론 뉴시스 yunghp@newsis.com