AI 데이터셋과 오픈소스 컴플라이언스 관련 사례
전통적인 라이선스 컴플라이언스 문제에서 AI 생성 코드와 학습 데이터의 저작권 문제로 소송의 양상이 변화하고있다. 이에 대한 데이터 컴플라이언스와 분쟁사례를 분석해본다.
현대 AI 학습 데이터 검토의 어려움
공개되거나 알려진 LLM 구축에 사용된 데이터에 저작권을 침해한 자료가 사용되었는지 확인할 수 없는 문제.
엄청난 파라미터 사이즈를 갖는 모델들이 주류가 되면서, 학습 데이터셋 또한 완전 새로운 데이터로만 구성 된 단순 구조 형태가 아닌, 성능 향상에 필요한 다양한 오픈소스로부터 수집 된 데이터들을 복합적으로 섞은 거대한 수직 계층형 구조를 가짐.
실제로 Open Source 학습데이터를 이용하는 경우, 해당 학습데이터의 모든 원본 데이터에 대한 법적 리스크를 검토해야 하는 어려움이 존재.
최근 소송 사례
Case1. Github Copilot이 제공하는 코드 기반이 라이선스를 위반한 정책인지 여부에 대한 소송 진행중
2022년 11월, 오픈소스 저작권자들은 AI 코딩 도구인 GitHub Copilot이 허가 없이 GitHub 공개 리파지토리에서 코드를 사용하여 저작권법 및 오픈소스 라이선스에 위반한다며 OpenAI, Microsoft 및 GitHub를 상대로 저작권 집단 소송 제기
미국의 디지털 밀레니엄 저작권법 제1202조 등의 위반 및 오픈소스 라이선스 고지의무 및 공개의무 위반이라고 주장
위반 횟수에 따른 법적 손해배상액으로 환산 90억 달러(약 11조 6000억원)로 추산
OpenAI 등은 반박 의견서를 제출하며 이 소송의 각하 신청을 요청하였으나 법원은 이를 기각
2024년 7월, 판사는 원고의 대부분의 주장을 기각하여 22건 중 2건으로 청구건수를 줄임
Case2. Tremblay v. OpenAI 사건 – 학습 데이터 전체 공개 명령
-
개요
원고: 작가 Paul Tremblay, Sarah Silverman 등, 피고 : OpenAI 외
주장: OpenAI가 저작권 보호 도서를 무단 수집해 GPT-4 훈련에 사용 → 직접 저작권 침해 및 캘리포니아 부정경쟁법 위반
-
법원 명령
2025년 1월, 연방법원은 OpenAI에 대해 GPT-4 훈련에 사용된 전체 English Colang 데이터셋을 원고 측에 제공하라고 명령
-
공개되는 데이터셋의 범위
- English Colang 전체 원본 데이터셋
- 보안실 내, 인터넷 차단된 컴퓨터에서만 열람 가능, 녹음/복사 불가, OpenAI가 메모 검열 가능
-
시사점
법원이 AI 학습 데이터 자체를 저작권 침해 판단의 핵심 증거로 인정하였으며, 추후 유사 제출 명령이 반복될 경우, 기업들은 데이터 출처나 처리 절차 관리 필요 가능성이 있음
Case3. The New York Times v. OpenAI : 소스코드 및 학습 내역 공개 명령
-
소송 개요
- 원고 : 뉴욕타임즈 (NYT), 피고 : OpenAI 외
- 주장 : OpenAI와 Microsoft가 NYT 뉴스 기사를 무단 수집해 GPT를 훈련시키고, GPT가 NYT 문구를 거의 그대로 복원함 → 직접 저작권 침해 및 계약 위반
-
법원 명령
2024년 말, 법원은 GPT 훈련 내역 및 ChatGPT의 소스코드 일부에 대한 열람을 허용
-
공개되는 소스코드의 범위
- GPT 학습 내역 일부
- ChatGPT 소스코드 열람은 샌드박스 환경 내에서만 허용, 인터넷 완전 차단, 녹화·복제 금지
-
시사점 AI 소스코드조차 법원의 사법 검토 대상이 될 수 있고, 모델 생성과정 전체가 증거 개시 대상이 될 수 있음
폐쇄형/개방형 모델 개요
AI 모델별 라이선스 비교
| 항목 | 폐쇄형 AI 모델 | 개방형 AI 모델 – 오픈 Weight 모델 (Non-Permissive) | 개방형 AI 모델 – 오픈 Weight 모델 (Permissive) | 개방형 AI 모델 – 오픈소스 AI 모델 |
|---|---|---|---|---|
| 라이선스 | Proprietary License | Non-Permissive License | Permissive License | OSI 인증 오픈소스 라이선스 |
| 가중치 공개 | X | X | O | O |
| 코드 공개 | O | O | O | O |
| 데이터 공개 | X | X | Δ | O |
| 예시 공개 | Δ | Δ | O | O |
| 대표 모델 | GPT-4(OpenAI), Gemini 2.5(Google), Llama 4(Meta), Gemma 3(Google), HyperCLOVA X(네이버), EXAONE 4.0(LG) | (별도 예시 미기재) | DeepSeek R1(DeepSeek), Qwen 3(Alibaba), GPT-OSS(OpenAI) | Bloom(Bloom AI) |
LLM 모델 라이선스 현황
| 기업 | 라이선스 | 주요 내용(사실 기반) | 자유도 | |
|---|---|---|---|---|
| ChatGPT | OpenAI | Proprietary | - 사용/배포/수정 권한 제한- 상업적 이용은 OpenAI 정책에 따라 제한적 허용 | 낮음 |
| Gemini | Google/DeepMind | Proprietary | - 모델 가중치 비공개- API 기반 사용 중심 | 낮음 |
| EXAONE | LG경영개발원 | EXAONE AI Model License Agreement 1.1 / 1.2 | - 연구 목적만 사용 가능(NC)- v1.2는 교육 목적 추가 허용- 다른 모델 개발 사용 금지- 라이선서가 라이선스 변경/해지 가능 | 낮음 |
| Llama | Meta | Llama Community License Agreement | - MAU 7억 이상은 별도 라이선스 필요- 수정 모델 이름은 “Llama”로 시작해야 함- Llama 산출물의 비-Llama 모델 사용 금지 조항은 v3.1에서 삭제 | 확장제한 |
| HyperCLOVA X | 네이버 | HyperCLOVA X SEED Model License Agreement | - MAU 1000만 이상은 별도 라이선스 필요- 수정 모델 이름 시작은 “HyperCLOVA X”로 고정 | 확장제한 |
| Gemma | Google/DeepMind | Gemma Terms of Use / Prohibited Use Policy | - 사용·수정·배포·상업적 이용 허용- 배포 시 라이선스 및 이용제한 고지 의무 | 높음 |
| Qwen | 알리바바 | Tongyi Qianwen RESEARCH LICENSE → Apache 2.0 | - 초기 연구 라이선스에서 Apache 2.0으로 전환- Apache 2.0은 완전한 Permissive | 높음 |
| DeepSeek | DeepSeek | DeepSeek License Agreement → MIT | - MIT 기반 완전한 Permissive | 높음 |
| DeepSeeK | Linux Foundation | OpenMDW License Agreement 1.0 | - 머신러닝 모델용 Permissive 라이선스(2025.5 발표)- “Model Materials” 정의: 모델·데이터·문서·SW 포함- 저작권·특허·DB·영업비밀 권리 부여- 배포 시 고지 의무·특허보복 조항 외 제한 없음 | 높음 |
기업 대응 사례 참고
LG EXAONE
- 데이터셋의 정보를 바탕으로 어떤 하위 데이터 소스로 데이터셋이 구성되어 있는지, 각 데이터 셋의 라이선스 정보가 어떻게 되는지를 자동적으로 탐색
- 사용하고자 하는 단일 데이터 셋이 아닌, 데이터 셋이 갖고 있는 모든 출처가 되는 데이터 셋의 법적 위험을 Data의 Life Cycle 측면에서 탐지
- 상업적으로 이용 가능하다고 판단된 2,852개의 AI 학습 데이터셋 중 종속 데이터의 리스크를 모두 고려해 본 결과, 21.21%인 605개의 데이터셋만 상업적으로 이용 가능했음.
- 법률적 검토과정에서 EXAONE NEXUS를 이용해 인간 변호사와 비교했을 때 45배 빠른 속도, 0.1% 수준의 비용, 26% 빠른 정확도로 검출
- 최종 검토는 인간 변호사 검토.
댓글 없음