AI 학습 데이터의 저작권 레드라인이 조여지고 있다. 2026년 9월 21일, 미국작가협회(Authors Guild)는 Alter v. OpenAI and Microsoft 소송에서 원고 측이 제출한 최신 서면에 인용된 내부 문서를 공개했다. OpenAI와 마이크로소프트 경영진은 해적판 도서 사이트 LibGen의 장서를 모델 학습에 사용하는 데 법적 리스크가 있다는 것을 수년 전부터 알면서도 강행했고, 2022년 여름에는 흔적 지우기를 시도했다는 것이다.
이 집단소송은 뉴욕 남부연방지방법원에서 심리 중(사건번호 1:23-cv-08292)이며, 두 회사를 상대로 한 광역계쟁소송(MDL)의 일부다. 원고에는 작가협회와 10여 명의 작가가 포함되어 있으며, 조지 R.R. 마틴, 존 그리샴 등이 이름을 올렸다. 2026년 9월 17일 원고 측은 일부 약식판결 신청 서면(Docket 1982)과 162쪽 분량의 사실진술서(Docket 1987)를 제출했고, 작가협회가 이를 대중에 공개했다.
무슨 일이 있었나: 해적판 도서 다운로드에서 'Project Clear'까지
원고 서면에 인용된 내부 문서에 따르면 시간 순서는 대략 다음과 같다.
2018년 OpenAI는 LibGen에서 약 11만 7500권의 도서를 다운로드한 뒤 약 35TB의 데이터를 토렌트로 가져갔다. 서면에 따르면 이는 당시 LibGen 전체 장서 460만 권에 해당한다. 2019년 4월 샘 올트먼이 빌 게이츠에게 GPT-3 초기 버전을 시연할 때 자료에는 "Library Genesis(LibGen)에서 약 110억 단어를 추가로 확보"했다고 명시되어 있었다. 두 달 뒤 마이크로소프트는 OpenAI에 10억 달러를 투자했다. GPT-3 논문에서 이 데이터는 'Books1'과 'Books2'로 불렸다.
더 중요한 것은 '인지'에 대한 증거다. 2020년 5월 OpenAI 정책 디렉터 잭 클라크는 사내에서 모델이 "사람들을 실업자로 만들 것"이며 "아티스트들이 우려를 표명하는 시점이 오겠지만 우리는 그 우려를 무시하고 어쨌든 출시할 가능성이 높다"고 썼다. 2022년 모델의 작문 능력 향상을 위해 입사한 타룬 고기네니는 작가들의 "데이터셋은 도둑질한 것"이라는 항의를 "감내 가능한 경제적 대가"로 치부하고, GPT가 '얼음과 불의 노래' 마지막 2권을 완성하는 구상까지 밝혔다.
마이크로소프트도 '인지' 추궁 대상이 됐다. 서면에 따르면 2019년 4월 시연 자리에서 올트먼과 당시 OpenAI 연구 디렉터였던 다리오 아모데이는 게이츠 등에게 LibGen 사용을 공개했다. 아모데이는 당시 LibGen을 "학습 데이터로서는 다소 의심스럽다(a bit sketchier)"고 평가했고, 연구원 샘 매캔들리시가 걱정한 것은 '체면'이었다. "Hacker News에 'OpenAI가 수상한 러시아 사이트의 저작권 데이터를 학습에 사용'이라고 뜨면 곤란하다"는 것이었다.
2022년 여름 OpenAI는 코드명 'Project Clear' 삭제 작전을 개시해 LibGen 파일을 삭제했다. 2022년 6월 15일 Slack 기록에는 문서와 채팅 기록 곳곳에 'libgen' 언급이 있다는 것을 어떻게 할 것이냐는 질문에, 연구 부사장 밥 맥그루가 그날 밤 이렇게 답했다. "OpenAI가 이토록 주목받는 지금이야말로 LibGen을 시스템과 저장소에서 제거할 적기다." 이에 앞서 오나 왕 판사는 이 Slack 기록에 대한 OpenAI의 특권 주장을 기각하고 'project-clear'와 'excise-libgen' 채널 기록 제출을 명령했다.
누구에게 영향을 미치나: AI 개발자가 직격, 작가·출판사는 지렛대를 얻다
가장 직접적인 영향은 AI 모델 개발자와 학습 데이터 책임자에게 미친다. 그동안 학습 데이터 저작권을 둘러싼 논쟁은 '공정 이용(fair use)이 학습 행위를 포괄하는가'에 머물렀지만, 이 서면은 전장을 '해적판 도서의 다운로드와 저장 자체가 침해인가', 그리고 회사가 '알면서도' 했는가로 앞당겼다. '인지'가 인정되면 공정 이용 항변의 여지는 크게 좁아진다. 미국 제9순회항소법원이 또 다른 AI 저작권 소송에서 다룬 것은 AI 생성물이 저작권 관리 정보를 삭제하는지였지만, 이 사건은 학습 데이터 출처의 적법성이 문제로 전혀 다른 전장이다.
작가와 출판사는 반대편에 있다. 작가협회 회원은 1만 8000명이며 원고에는 베스트셀러 작가도 다수 포함됐다. 주목할 점은 이 문서 공개 며칠 전 뉴욕타임스 대 마이크로소프트·OpenAI 소송에서도 유사한 문서가 공개되어, 수백만 건의 뉴스 학습 이용이 신문 업계에 '생존적 위협'이 된다고 드러났다는 것이다. 두 전선이 호응하기 시작했다.
다만 경계선을 분명히 해야 한다. 위 내용은 모두 원고 측 서면과 거기에 인용된 내부 문서에 근거한 일방적 주장이다. 침해 성립 여부나 공정 이용 적용에 대해 법원은 아직 판단하지 않았다. 서면이 구하는 것은 일부 약식판결이며, 향후 수개월간 양측이 추가로 서면을 제출하고 심리는 2027년 초로 예상된다.
무엇을 해야 하나: 기록 삭제보다 데이터 계보 감사부터
모델을 학습시켰거나 학습 중인 팀에게 이 소송이 제시하는 실행 가능한 대응은 네 가지다.
첫째, 학습 데이터셋에 LibGen, Z-Library 같은 해적판 출처가 섞여 있는지 점검하라. 데이터 출처, 취득 방법, 라이선스 상태를 기록하는 완전한 데이터 계보 감사를 실시한다.
둘째, 라이선스 협상은 가능한 한 빨리. Anthropic은 유사한 해적판 도서 학습 소송(Bartz v. Anthropic)에서 15억 달러에 합의했다. '일단 만들고 나중에 허락받는' 방식의 비용은 사전 라이선스보다 훨씬 클 수 있다.
셋째, 해적판 데이터를 발견하면 흔적을 남기고 제거하되 'Project Clear'를 따라 해서는 안 된다. 삭제가 증거 인멸로 해석되면 오히려 '인지'의 뒷받침이 된다. 이 사건에서 판사가 관련 Slack 기록 전체 제출을 명령한 이유가 바로 그것이다.
넷째, 사내 커뮤니케이션 관리다. Slack, 문서, 논문 초안에서 데이터 출처에 대한 논의는 모두 증거 개시 대상이 된다. 근본 해결책은 사후 '체면' 관리가 아니라 사전 컴플라이언스다.
리스크는 어디에 있나: 세 개의 숫자와 하나의 시점
첫 번째 숫자는 15만 달러. 미국 저작권법상 '고의 침해'의 법정 손해배상 상한(작품당)이다. 원고 서면이 '인지'를 축으로 구성된 이유는 바로 이 배상 구간에 도달하기 위해서다. 11만 7500권에 15만 달러를 곱하면 천문학적 숫자가 된다.
두 번째 숫자는 15억 달러. Anthropic 사건의 합의금이다. 병행 소송에서 연방 판사는 이미 이렇게 판단했다. 해적판 도서의 불법 다운로드 자체가 독립된 침해이며, 나중에 정품을 구매해도 마찬가지다. 이 판례 논리가 이 사건에도 이어지면 OpenAI의 공정 이용 방어는 한층 어려워진다.
세 번째 리스크는 시점이다. 심리는 2027년 초로 예상되며 향후 수개월간 양측이 추가로 서면을 제출한다. 제3자 모델 API를 이용하는 기업에게 리스크는 간접적이지만 현실적이다. 학습 데이터의 적법성에 문제가 있다고 판단되면 공급업체의 컴플라이언스 하자가 공급망을 타고 전파될 수 있다.
마지막으로 적용 범위를 짚는다. 이 소송은 미국 저작권법 아래에서 다투어지고 있으며, LibGen은 2017년부터 미국 무역대표부의 '악명 높은 시장' 목록에 올라 있다. 학습 데이터 규칙은 관할권마다 다르므로 미국 법원의 향방을 글로벌 사업에 그대로 대입할 수 없다.
AI 기업에게 이 소송은 학습 데이터 컴플라이언스를 '법무 자문'에서 '증거 개시' 수준의 리스크로 격상시켰다. 데이터가 어디서 왔는지, 누가 알았는지, 언제 알았는지. 그 모든 것이 법정 증거가 될 수 있다.