AI 학습 데이터 수집 논란: '역사상 최대 규모의 노동력 도난' 지적
Microsoft exec called AI scraping 'the largest theft of labor in human history'
Hacker News뉴욕타임스 소송에서 마이크로소프트와 오픈AI의 내부 문건이 공개되며, AI 학습을 위한 콘텐츠 무단 수집(스크레이핑) 행위가 '역사상 최대 규모의 노동력 도난' 수준이었다는 사실이 드러났습니다.
- AI 기술이 원본 콘텐츠 시장 자체를 대체하고 경제적 기반을 위협하며, 이는 기존의 법적 방어 논리인 ‘공정 이용’ 개념과 정면으로 충돌합니다.
- 이는 AI가 단순한 변형을 넘어, 원본 창작자의 노동력과 콘텐츠 공급망 전체를 직접적으로 대체하는 구조적 위험을 내포함을 시사합니다.
- 다만, 이번에 공개된 내용 중 일부는 원고 측(NYT 등)의 요약 자료를 기반으로 하며, 소송의 핵심 증거물은 아직 봉인되어 있어 추가 확인이 필요합니다.
뉴욕타임스가 제기한 소송에서 공개된 내부 문건에 따르면, AI 기업들의 콘텐츠 학습 방식이 단순한 이용을 넘어선 심각한 문제로 지적되었습니다. 마이크로소프트의 고위 임원은 이러한 AI 훈련 과정을 '도난(theft)'으로 규정했으며, 오픈AI 측 리더십 역시 자신들의 모델이 원작자들에게 '실존적 위협'이라고 언급했습니다. 문건에는 이들 기업이 결제 장벽(paywall)을 감지되지 않게 우회하고 대규모 스크레이핑을 통해 훈련 데이터셋을 구축했으며, 심지어 학습 데이터에서 저작권 고지까지 의도적으로 제거했다는 내용이 담겨 있습니다.
AI 기술의 발전은 원본 콘텐츠 시장 자체를 대체하며 경제적 기반을 위협한다는 지적이 제기되고 있습니다. 법적 방어 논리 중 하나인 '공정 이용(fair use)' 개념에도 불구하고, 내부 자료들은 AI가 원작물의 시장을 대체하거나 해치는 방식으로 작동했음을 보여줍니다. 예를 들어, 마이크로소프트의 Copilot 답변 엔진이 뉴욕타임스 도메인의 클릭률을 기존 빙 검색 대비 최대 93%까지 떨어뜨렸다는 데이터가 제시되었습니다. 이는 기술이 단순히 변형하는 것을 넘어 원본 창작자의 노동력과 콘텐츠 공급망 전체를 직접적으로 대체할 위험성을 내포하고 있습니다.
문건들은 AI 기업들이 데이터를 수집한 규모와 방식을 구체적으로 밝히고 있습니다. 오픈AI의 중기 훈련 데이터셋만 해도 NYT, Daily News 등에서 출판된 작품 91,692개 이상의 복사본을 포함하고 있으며, Common Crawl 기반 데이터셋에는 nytimes.com에서만 2백만 개가 넘는 문서가 포함되어 있습니다. 또한, 오픈AI 직원들은 결제 장벽 우회 방법을 논의했으며, 프로젝트 망고 같은 이니셔티브를 통해 최소 160,903개의 고유한 작품을 담은 데이터셋을 구축하는 등 체계적인 수집 과정을 거쳤음이 드러났습니다.