생성형 인공지능(AI) 시장을 선도하는 오픈AI가 챗GPT 개발 과정에서 언론사 기사 1,000만 건을 무단으로 사용했다는 구체적인 폭로가 나오며 글로벌 테크 업계가 거센 후폭풍에 휩싸였다. 이번 사태는 단순한 기술적 논쟁을 넘어 AI 학습 데이터의 적법성과 향후 글로벌 빅테크 기업들의 비즈니스 모델 존폐를 가를 중대한 법적·산업적 분수령이 될 것으로 분석된다. 특히 저작권 침해에 대한 대규모 소송이 본격화되면서 AI 산업 전반의 비용 구조가 근본적으로 흔들릴 수 있다는 지적이 나온다.

■ '기사 1000만 건 무단 수집'… 오픈AI 저작권 침해 규모 역대 최대
최근 공개된 법정 문서와 외신 분석에 따르면, 오픈AI는 챗GPT의 거대언어모델(LLM)을 고도화하는 과정에서 약 1,000만 건에 달하는 언론사 기사와 뉴스를 무단으로 수집해 학습에 활용한 것으로 드러났다. 이는 그동안 베일에 싸여 있던 AI 학습 데이터의 구체적인 침해 규모가 실증적으로 제시된 첫 사례다. 정보기술(IT) 업계에서는 오픈AI가 고품질의 저작물 데이터를 무단으로 크롤링(웹 정보 수집)하여 자사 상업 서비스의 경쟁력을 높이는 데 사용했다는 비판을 피하기 어려울 것으로 보고 있다. 저작권자들의 동의나 정당한 대가 지불 없이 이루어진 무단 학습은 저작권법상 '공정이용(Fair Use)'의 범위를 크게 일탈했다는 것이 법조계의 중론이다.

■ '공정이용' 방패 무너지나… 글로벌 빅테크 저작권 소송 비상
그동안 오픈AI를 비롯한 구글, 메타 등 빅테크 기업들은 인터넷상에 공개된 데이터를 학습용으로 사용하는 행위가 저작권법상 면책 특권인 '공정이용'에 해당한다고 주장해 왔다. 그러나 이번 폭로를 기점으로 사법부와 규제 당국의 기류가 급변하고 있다. 주요 언론사들은 연대 전선을 구축하고 무단 사용에 대한 조 단위 규모의 손해배상 소송을 준비 중이며, 이미 진행 중인 소송에서도 빅테크 측에 불리한 증거들이 잇따라 채택되는 모양새다. 시장에서는 이번 소송 결과에 따라 AI 기업들이 과거에 수집한 데이터를 전면 폐기하거나, 천문학적인 합의금을 지급해야 하는 최악의 시나리오까지 거론되고 있다.

■ 고품질 데이터 고갈 속 '유료 계약' 필수… AI 개발 비용 급증 전망
이번 사태는 향후 AI 개발 생태계의 패러다임을 송두리째 바꿀 것으로 전망된다. 앞으로 빅테크 기업들은 합법적인 데이터 확보를 위해 언론사 및 콘텐츠 보유 기업들과 연간 수천만 달러 규모의 라이선스 계약을 맺어야 하는 상황에 직면했다. 실제로 이미 일부 대형 언론사들과 독점적 데이터 공급 계약을 체결하는 사례가 늘고 있으나, 이는 자금력이 부족한 중소 AI 스타트업에게는 감당하기 힘든 진입 장벽으로 작용할 수 있다. 결과적으로 합법적 데이터 확보 비용이 급증하면서 AI 기술 개발의 양극화가 심화되고, 서비스 이용료 인상으로 이어질 가능성이 높다는 분석이 지배적이다.

■ 공실뉴스 시장전망 & 체크포인트

향후 AI 산업은 무단 데이터 무임승차 시대가 종언을 고하고, 정당한 대가를 지불하는 '유료 라이선스 생태계'로 급격히 재편될 전망이며, 이는 콘텐츠 지식재산권(IP)을 보유한 기업들의 가치 상승으로 이어질 것입니다. 부동산 및 자산 투자자들은 프롭테크나 AI 기반 자산관리 솔루션을 도입할 때 해당 서비스가 사용하는 데이터의 저작권 분쟁 소지 여부를 선제적으로 검증해야 하며, 향후 AI 서비스 이용료 인상에 따른 운영 비용 상승 가능성도 자금 계획에 반영해야 합니다.