생성형 AI 학습 데이터 라이선스 구매 원가 및 저작권 침해 소송 배상액 리스크: 인공지능 자본주의의 숨겨진 청구서
우리는 매일 스마트폰이나 PC로 챗GPT나 클로드 같은 인공지능과 대화를 하거나 도움을 받고 있습니다. 업무용 이메일을 대신 써달라고 부탁하기도 하고, 복잡한 외국어 문서를 단 몇 초 만에 번역해 내는 놀라운 결과를 얻기도 합니다. 소비자 입장에서 이 모든 과정은 마치 허공에서 지식이 솟아나는 것처럼 자연스럽고, 비용에 대한 큰 부담 없이 이루어집니다.
하지만 자본 시장의 논리로 이 혁신의 이면을 들여다보면 완전히 다른 풍경이 펼쳐집니다. 인공지능이 이토록 정교한 답변을 내놓을 수 있었던 이유는 전 세계의 웹사이트, 뉴스, 책, 게시판 등에 흩어진 방대한 텍스트 데이터를 쉼 없이 읽어 들이며 학습했기 때문입니다.
과거에는 이 데이터 학습 과정이 별다른 비용 없이 이루어졌지만, 이제는 원작자들이 정당한 권리와 대가를 요구하며 법정으로 향하고 있습니다. 세상을 바꿀 기술 혁신 이면에 자리 잡은 재무적 리스크와, 인공지능 기업들의 손익계산서가 어떻게 변화하고 있는지 그 자본의 논리를 해부해 보겠습니다.
과거 거대언어모델을 개발하는 기술 기업들에게 인터넷 공간은 자유롭게 정보를 수집할 수 있는 열린 무대였습니다. 웹 크롤링 기술을 통해 공개된 데이터를 긁어모아 모델을 학습시켰고, 이 시기에 데이터 수집 원가는 인프라 운영비를 제외하면 사실상 큰 비중을 차지하지 않았습니다.
하지만 인공지능 산업이 큰 수익을 창출하기 시작하면서, 원본 데이터를 생산한 언론사와 창작자들의 거센 반발이 시작되었습니다. 여기서 투자자들이 가장 주의 깊게 살펴야 할 핵심은, 공개 웹 데이터를 학습에 사용한 행위가 어디까지 공정이용으로 인정되고, 어디서부터 라이선스 비용이나 손해배상 위험으로 전환되는지가 아직 미국 법원에서 명확하게 정리되지 않았다는 점입니다.
실제 법원의 판단은 사건마다 엇갈리고 있습니다. 2025년 진행된 'Bartz v. Anthropic' 사건에서는 인공지능 모델 클로드(Claude)의 학습 과정에서 책을 복제한 행위를 공정이용으로 판단했습니다. 또한 'Kadrey v. Meta' 사건에서도 해당 원고들이 제출한 기록을 기준으로 볼 때, 메타의 모델 학습 사용에 대해 공정이용 방어가 인정되었습니다.
다만 같은 판결에서도 해적판 라이브러리에서 책을 다운로드해 별도의 중앙 라이브러리를 구축한 행위는 공정이용으로 인정되지 않았기 때문에, 법원 역시 ‘학습 목적’과 ‘데이터를 확보한 방식’을 구분해 판단했습니다.
하지만 뉴욕타임스가 오픈AI를 상대로 제기한 소송에서는 오픈AI 측의 여러 저작권 관련 청구 기각 요청이 받아들여지지 않았으며, 현재도 본안 다툼이 치열하게 계속되고 있습니다.
이처럼 법원의 판단이 갈리고 있다는 사실 자체가 인공지능 산업에 자본을 투입하는 기관 투자자들에게는 투자 리스크로 작용합니다. 기술 혁신의 속도만큼이나, 법적 리스크를 방어하기 위한 비용이 기업의 재무제표를 짓누를 가능성이 열려 있기 때문입니다.
이러한 법적 불확실성 속에서 기업들의 대응 전략은 크게 두 갈래로 나뉘며, 이는 기업의 밸류에이션(기업 가치)을 평가하는 결정적 잣대가 됩니다.
가장 대표적인 리스크 사례는 앞서 언급한 뉴욕타임스(NYT)와 오픈AI, 마이크로소프트 간의 법적 분쟁입니다. NYT는 수십억 달러 규모의 손해배상과 자사 저작물을 포함한 특정 모델 및 데이터셋에 대한 폐기 명령까지 요구하고 있습니다. 하지만 투자자들은 이것이 원고 측이 청구한 '구제 수단'일 뿐, 실제 책임 범위와 배상액이 법원에 의해 확정된 것은 아니라는 점을 냉정하게 인지해야 합니다.
반면, 이 변화를 새로운 수익 창출의 기회로 삼는 기업들도 등장했습니다. 독점 데이터를 보유한 글로벌 커뮤니티 플랫폼 레딧(Reddit)은 오픈AI에 Reddit Data API 접근을 제공하는 파트너십을 체결했고, 뉴스 코프(News Corp)는 오픈AI와 다년간의 콘텐츠 파트너십을 체결하며 데이터와 콘텐츠를 새로운 수익·협력 자산으로 전환하고 있습니다.
특히 레딧은 콘텐츠 라이선스 계약을 통해 짭짤한 부가 수익을 올리고 있습니다. 2026년 3월 말 기준 레딧의 1년 초과 계약 잔여이행의무(앞으로 인식할 매출)는 약 1억 2,060만 달러에 달했으며, 회사는 이것이 주로 장기 콘텐츠 라이선스 계약에서 발생한다고 공시했습니다.
그러나 데이터 판매가 단순히 비용이 전혀 들지 않는 '마법의 수익원'이라고 오해해서는 안 됩니다. 데이터 라이선스는 기존 콘텐츠 자산을 추가 매출로 전환할 수 있는 고부가가치 수익원이 될 가능성이 있지만, 서버 등 플랫폼 운영비, 데이터 인프라 유지, 법무 검토, API 제공 등에 상당한 비용이 수반되므로 실제 마진율은 계약 구조와 데이터 제공 비용에 따라 크게 달라집니다.
아래의 지표는 데이터를 둘러싼 주요 기업들의 사례와, 투자자가 짚어봐야 할 재무적 지표를 명확히 보여줍니다.
| 사례 | 확인된 사실 | 아직 확정되지 않은 부분 | 투자자가 볼 지표 |
|---|---|---|---|
| NYT vs OpenAI·Microsoft | 손해배상·모델/데이터 폐기 요구 | 책임·배상액·구제수단 | 법률비용·모델 재구축 위험 |
| 콘텐츠 라이선스 매출 발생·확대 | 개별 계약 마진 | 기타매출·잔여이행의무 | |
| News Corp | OpenAI와 다년 파트너십 | 계약금액·실제 수익성 | 라이선스 매출 기여도 |
| Synthetic Data | 재귀 학습 시 collapse 위험 | 안전한 혼합비율·품질 효과 | 데이터 비용 대비 성능 |
(데이터 기준 시점: 2026년 8월 기준 / 출처: Reddit 공시 자료 및 주요 기업 간 파트너십 발표 내역 종합 재구성)
이처럼 방대한 데이터 라이선스 구매 비용과 소송 관련 충당부채 리스크가 커지자, 기술 기업들은 비용을 절감하기 위한 대안으로 '합성 데이터(Synthetic Data)'에 눈을 돌리고 있습니다. 이는 기존 인공지능이 스스로 만들어낸 텍스트나 이미지를, 다른 인공지능이 다시 교과서처럼 읽고 학습하게 만드는 방식입니다.
비용 측면에서는 매력적인 해결책처럼 보입니다. 하지만 비유하자면, 선명한 원본 사진을 복사기로 복사한 뒤, 그 복사본을 다시 끝없이 복사하면 결국 형태를 알아볼 수 없게 뭉개지는 것과 같은 원리가 작용합니다.
전문가들은 검증되지 않은 합성 데이터를 세대마다 재귀적으로 학습시키면, 원본 데이터 분포의 희귀한 특성이 점차 사라지면서 모델의 품질이 무너지는 '모델 붕괴' 현상이 발생할 위험이 있다고 경고합니다.
따라서 합성 데이터가 비용 절감의 대안이 되기 위해서는, 인간이 만든 원본 데이터와 인공지능이 생성한 데이터를 얼마나 안전한 비율로 혼합하고 꼼꼼하게 품질을 관리하느냐가 핵심입니다.
자본 시장에서 인공지능 기업의 경쟁력과 해자는 단순히 "누가 데이터를 가장 많이 사느냐"로 결정되지 않습니다. 진정한 투자 가치를 가늠하려면, 라이선스 구매 비용, 데이터 정제 및 필터링, 법무 비용, 그리고 컴퓨팅 비용을 모두 합친 총 '단위 경제'가 모델의 품질 향상에 얼마나 효율적으로 기여하는가를 분석해야 합니다.
이제 데이터 확보의 법적, 재무적 지속가능성 여부가 향후 AI 기업 투자의 가장 확실한 기준점이 될 것입니다.
작성자 : 비즈도슨트
자료 확인일 : 2026년 08월 18일
참고자료 및 출처 :
미국 캘리포니아북부연방지방법원 「Bartz et al. v. Anthropic PBC」
미국 캘리포니아북부연방지방법원 「Kadrey et al. v. Meta Platforms, Inc.」
미국 뉴욕남부연방지방법원 「The New York Times Company v. Microsoft Corporation et al.」
Reddit 「Quarterly Report on Form 10-Q, March 31 2026」
Reddit 「Reddit and OpenAI Build Partnership」
OpenAI 「OpenAI and Reddit Partnership」
OpenAI 「A Landmark Multi-Year Global Partnership with News Corp」
Nature 「AI Models Collapse When Trained on Recursively Generated Data」
※ 생성형 AI 학습에 저작물을 이용하는 행위의 공정이용 여부는 데이터 확보 방식, 사용 목적, 시장 영향 및 개별 사건의 사실관계에 따라 달라질 수 있으며, 현재 미국에서도 모든 AI 학습을 일률적으로 합법 또는 불법으로 판단하는 통일된 기준이 확립된 상태는 아닙니다.
댓글
댓글 쓰기