블로그를 운영하거나 글·사진을 올리는 사람이라면 한 번쯤 드는 질문입니다. “내 글을 AI 회사가 긁어다 학습시켜도 되는 건가.” 한국에서는 이 질문에 대한 정부의 공식 안내가 올해 2월에 나왔습니다. 문화체육관광부와 한국저작권위원회가 2026년 2월 26일 펴낸 ‘생성형 인공지능의 저작물 학습에 대한 저작권법상 공정이용 안내서’(81쪽)입니다. 결론부터 말씀드리면 안내서는 “된다”도 “안 된다”도 아니라, 네 가지 요소로 사안마다 따진다는 틀을 줍니다. 이 글은 그 네 요소가 무엇이고 각각 어느 쪽에 유리하게 작용하는지, 그리고 권리자와 이용자가 각자 할 수 있는 일을 정리합니다. 내용은 2026년 9월 6일 기준입니다.
목차
안내서가 답하는 질문
저작권법 제35조의5는 “저작물의 통상적인 이용 방법과 충돌하지 않고 저작자의 정당한 이익을 부당하게 해치지 않는” 이용을 허용하는 공정이용 조항입니다. AI 학습이 여기 해당하는지가 쟁점인데, 안내서는 한국저작권위원회 사이트에 공개돼 있고 생성형 AI 개요, 침해 위험, 공정이용 해설, 분쟁 대응의 네 부로 짜여 있습니다. 중요한 전제가 하나 있습니다. 안내서 스스로 “유권해석이 아니며 향후 법령·판례·기술 변화에 따라 내용이 달라질 수 있다”고 밝힙니다. 법원이 아니라 행정부가 낸 기준이라는 뜻입니다.
네 가지 판단 요소
법 조항이 정한 네 요소와, 김·장 법률사무소의 해설이 정리한 안내서의 유리·불리 사정입니다.
| 요소 | 공정이용에 유리 | 불리 |
|---|---|---|
| ① 이용의 목적 및 성격 | 게시물·도서의 표현을 재현·대체하려는 게 아니라 범용 대화·생성 능력을 구현하는 학습 | 특정 콘텐츠의 표현을 실질적으로 동일하거나 유사하게 생성 |
| ② 저작물의 종류 및 용도 | 창작성이 상대적으로 낮은 사실·정보 전달 콘텐츠 | 문학적·예술적 창작성이 높고 표현의 개성이 강한 저작물 |
| ③ 이용된 부분의 비중과 중요성 | 범용 능력 구현에 합리적으로 필요한 범위 | 그 범위를 양적·질적으로 초과한 이용 |
| ④ 시장 또는 가치에 미치는 영향 | 원 저작물의 열람·판매를 실질적으로 대체하지 않음 | 판매 감소, 경제적 손해, 이용허락 기회 박탈 |
이 표에서 블로그 글의 자리를 찾아보면 이렇습니다. 사실과 정보를 전달하는 글(②에서 유리)을 범용 모델 학습에 썼고(①에서 유리) 그 모델이 내 글을 그대로 뱉지 않으며(①·④에서 유리) 내 블로그 방문이 줄지 않았다면(④에서 유리), 학습 쪽이 공정이용을 주장하기 쉬운 구조입니다. 반대로 소설·시·삽화처럼 개성이 강한 창작물이고, 모델이 그 문체나 그림체를 재현해 원작 수요를 대체한다면 권리자 쪽이 유리합니다.
세 가지 오해를 바로잡는 대목
- “상업적 학습은 무조건 안 된다”는 아닙니다. 문체부는 “상업적 목적이나 웹 크롤링 방식의 인공지능 학습이라도 공정이용에서 배제되는 것은 아니며, 결국 각 요소별 유불리에 따라 종합적으로 판단”한다고 명확히 했습니다. 초안에 있던 “이용 계약 체결 시도, 사용료 협상” 같은 구체적 예시는 최종본에서 빠졌고, 영리성의 비중이 낮다는 판례가 추가됐습니다.
- “크롤링 자체가 불법”도 아닙니다. 다만 법률사무소 해설과 보도에 따르면, 접근이 제한된 자료나 권리자가 학습을 명확히 거부한 자료, 불법 게시물은 불리하게 봅니다. 담장을 넘어 가져간 자료와 공개된 자료는 다르게 취급된다는 뜻입니다.
- “안내서만 따르면 안전하다”도 아닙니다. 유권해석이 아니고 법원의 판단이 남아 있습니다. 미국에서 진행 중인 소송들과 결이 비슷한 틀이지만, 한국 법원이 같은 결론을 내리리라는 보장은 없습니다.
권리자가 할 수 있는 것
- 학습 거부 의사를 기계가 읽을 수 있게 남깁니다. robots.txt에 AI 크롤러(GPTBot, ClaudeBot, Google-Extended 등)를 막거나, 이용약관에 학습 금지를 적는 방식입니다. 안내서 틀에서 “명확히 거부한 자료”라는 사정을 만들어 두는 일입니다.
- 창작성이 높은 콘텐츠는 접근을 제한합니다. ②·④ 요소에서 권리자에게 유리한 사정이 생깁니다.
- 대체 여부를 기록합니다. 모델이 내 글을 사실상 그대로 내놓는 사례가 있다면 캡처해 둡니다. ①·④에서 결정적인 증거입니다.
반대로 AI로 만든 결과물의 저작권이 누구 것인지는 다른 문제이고, 저작권 글에서 다뤘습니다. 학습에 쓰이는 것이 개인정보라면 저작권이 아니라 8월 개정된 개인정보보호법의 영역입니다.
robots.txt로 학습만 거부하는 법
가장 현실적인 수단은 크롤러별 차단입니다. 검색 노출은 유지하고 학습 수집만 막으려면 AI 학습용 크롤러 이름을 골라 막습니다. 예를 들어 사이트 루트의 robots.txt에 아래처럼 적으면 OpenAI·Anthropic·구글의 학습 크롤러는 막고 검색 크롤러는 그대로 둡니다.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
다만 두 가지 한계가 있습니다. 첫째, robots.txt는 약속이지 강제가 아니라 지키지 않는 크롤러를 막지는 못합니다. 둘째, 이미 학습에 쓰인 자료를 되돌리지는 못합니다. 그래도 안내서의 틀에서 “권리자가 학습을 명확히 거부했다”는 사정을 남기는 가장 값싼 방법이라, 거부 의사가 있다면 지금 적어 두는 편이 낫습니다.
이용자(개발자)가 할 수 있는 것
학습 데이터를 모으는 쪽이라면 안내서의 틀을 체크리스트로 쓰면 됩니다. 접근 제한과 거부 표시를 존중했는가, 특정 저작물을 재현하는 방향으로 튜닝하지 않았는가, 범용 능력에 필요한 범위를 넘지 않았는가, 원작 시장을 대체하는 서비스가 아닌가. 정부가 8월 27일 AI 허브에 푼 학습데이터 29종처럼 권리 처리가 끝난 데이터가 늘어나는 것도 이 부담을 줄이는 방향입니다.
자주 묻는 질문
내 블로그가 이미 학습됐는지 알 수 있나요?
확실한 방법은 없습니다. 모델에 내 글의 고유한 문장을 물어 재현되는지 보는 정도이고, 그것도 검색 기능이 켜져 있으면 학습이 아니라 검색 결과일 수 있습니다.
robots.txt로 막으면 검색 노출도 사라지나요?
아닙니다. AI 학습용 크롤러(예: Google-Extended)와 검색용 크롤러(Googlebot)는 이름이 달라 따로 막을 수 있습니다. 학습만 거부하고 검색은 허용하는 설정이 가능합니다.
안내서 영문본이 있나요?
5월에 영문본이 제작돼 국제기구를 통해 배포됐다고 보도됐습니다. 한국 기준을 해외에 알리기 위한 것이고, 법적 효력은 국문본과 같이 안내에 그칩니다.
정리
“내 글을 AI가 학습해도 되나”의 답은 네 요소를 통과하느냐에 달렸고, 사실 전달형 글을 범용 모델이 재현 없이 학습한 경우가 가장 통과하기 쉬운 자리입니다. 권리자가 할 일은 거부 의사를 기계가 읽게 남기고, 대체 사례를 기록하는 것입니다. 안내서는 유권해석이 아니므로 최종 답은 법원에서 나옵니다.
참고: 문화체육관광부·한국저작권위원회 안내서(2026-02-26), 김·장 법률사무소 해설 (2026년 9월 6일 확인)