AI는 인간의 데이터와 AI의 데이터를 구분하는가: 5년 뒤 학습의 질문
구분 기술은 나왔지만 경계는 흐리다. 인간이 고른 AI 산출물은 누구의 것인가. 인간 데이터가 고갈된 뒤 AI는 인간의 가치를 배울 수 있는가.

핵심 요약
- 이미지·영상·음성에는 AI 산출물을 표시하는 기술이 자리 잡았다. 2026년 5월 OpenAI와 구글이 C2PA 출처 정보와 SynthID 워터마크를 함께 심기로 했고 카카오, 엔비디아, 일레븐랩스가 따랐다. 그러나 텍스트는 사실상 표시가 없고, 사람이 고르고 고친 AI 산출물은 어느 기술도 깔끔하게 가르지 못한다(C2PA Viewer).
- 공개된 인간 텍스트는 약 300조 토큰이고 2026~2032년 사이 소진될 전망이다. 그 뒤 학습 데이터의 큰 몫은 AI가 만든 것이 된다. AI 산출물만 되먹이면 모델은 붕괴하지만, 실데이터를 계속 섞으면 붕괴는 막을 수 있다는 것이 연구의 합의다(Nature).
- 운영자의 전망: 이 질문의 답은 기술이 아니라 정의에 있다. 인간이 골라 남긴 AI 산출물은 인간의 선택이 담긴 데이터다. 다만 그 선택이 "무엇을 만들까"에서 "무엇을 남길까"로 옮겨 가는 순간, 인간의 가치는 데이터 안에 있는 것이 아니라 고르는 손에만 남는다.
지난 글에서 AI가 AI를 만드는 루프를 다뤘다. 메타의 뮤즈 스파크 1.3은 이전 세대 모델이 문제를 만들고 채점해서 다음 세대를 학습시켰다(TechTimes). 그 글이 남긴 질문이 있다. 그렇게 배운 모델은 무엇을 배운 것인가. 인간을 배운 것인가, 인간을 배운 기계를 배운 것인가. 이 글은 PRISM AGENDA의 운영자가 던진 네 개의 질문을 순서대로 따라간다.
첫째 질문: AI는 두 데이터를 구분하는가
짧은 답은 “매체에 따라 다르고, 어느 매체에서도 완전하지 않다”이다.
| 매체 | 표시 기술 | 2026년 상태 | 한계 |
|---|---|---|---|
| 이미지·영상 | C2PA 출처 정보 + SynthID 워터마크 | OpenAI·구글·카카오·엔비디아 채택. 구글 검색·크롬에 검증 기능 예정 | 스크린샷·크기 조정·재인코딩으로 출처 정보가 사라짐. 워터마크는 “누가, 언제, 무엇을 고쳤는지” 말하지 못함 |
| 음성 | SynthID 오디오, 일레븐랩스 채택 | 주요 생성 서비스는 표시 | 녹음·재생을 거치면 약해짐 |
| 텍스트 | 통계적 탐지기, 일부 워터마크 | 사실상 표준 없음 | 사람이 한 문장만 고쳐도 신호가 흐려짐 |
출처: C2PA Viewer, EyeSift. 소비자용 이미지 탐지기의 정답률은 7090%, 실제 사진을 AI로 잘못 판정하는 비율은 515%.
이미지에서는 진전이 분명하다. 2026년 5월 19일 OpenAI와 구글이 출처 정보와 워터마크를 이중으로 심는 데 합의했고, 같은 날 카카오도 동참했다(C2PA Viewer). 그러나 두 가지 구멍이 남는다. 첫째, 텍스트다. AI가 만드는 데이터의 가장 큰 덩어리인 글에는 실효성 있는 표시가 없다. 둘째, 편집이다. 출처 정보는 파일이 바뀌면 깨지거나 “수정됨”으로만 남는다. 사람이 AI 이미지를 잘라 붙이고, AI 초고를 절반 고쳐 쓰면 어느 기술도 그것을 “인간 데이터”와 “AI 데이터”로 가르지 못한다.
학습하는 AI의 입장에서 답은 이렇다. 표시가 붙은 일부는 구분할 수 있고, 표시 없는 다수는 구분할 수 없으며, 가장 많은 종류인 섞인 것은 구분이라는 개념 자체가 맞지 않는다.
둘째 질문: 인간이 고른 AI 산출물은 누구의 데이터인가
이 질문에는 이미 한 사회가 답을 내놓았다. 저작권법이다.
미국 연방대법원은 2026년 3월 2일 AI가 단독으로 만든 작품에 저작권을 인정하지 않은 판결을 그대로 두었다(Morgan Lewis). 저작권은 인간의 창작에만 있다. 그런데 미국 저작권청은 같은 원칙 아래서 AI를 사용한 작품 수백 건을 등록했다. 기준은 인간이 표현 요소를 실질적으로 통제했는가다. 프롬프트만 넣은 것은 아무리 상세해도 부족하고, AI 산출물을 골라 배치하고 고친 것은 인정될 수 있다(Jones Day).
이 기준을 학습 데이터에 옮기면 세 층이 생긴다.
| 층 | 예 | 저작권법의 답 | 학습 데이터로서의 성격 |
|---|---|---|---|
| 인간이 만든 것 | 손으로 쓴 글, 직접 찍은 사진 | 인간 저작 | 인간 데이터 |
| 인간이 시켜서 AI가 만든 것 | 프롬프트 한 줄로 생성한 이미지 | 저작권 없음 | AI 데이터 |
| AI가 만들고 인간이 고르고 고친 것 | 열 개 중 하나를 골라 절반 다듬은 글 | 통제가 실질적이면 인간 저작 | 경계 위 |
세 번째 층이 문제다. 그리고 앞으로 데이터의 대부분이 이 층에서 나온다. 저작권법은 “실질적 통제”라는 말로 선을 그었지만 그 선이 어디인지는 사건마다 정한다. 학습하는 AI에게 그런 판단은 없다. 그저 파일이 있을 뿐이다.
셋째 질문: 서툰 인간 데이터와 능숙한 AI 데이터
운영자가 던진 셋째 질문은 이렇다. 인간 데이터에는 초보의 서툰 글부터 대가의 글까지 모든 수준이 섞여 있다. AI 데이터는 대체로 “전문가 수준”의 균질한 산출물이다. 둘을 함께 배우면 무엇이 달라지는가.
연구는 이 질문에 간접적으로 답한다. 2024년 네이처 논문은 모델이 자기 세대의 산출물만 되먹여 배우면 세대를 거듭할수록 분포의 꼬리, 곧 드문 것과 특이한 것을 먼저 잊고 결국 균질한 잡음으로 붕괴한다는 것을 보였다(Nature). 후속 연구들은 조건을 좁혔다. 실데이터를 버리지 않고 누적하면 붕괴는 일어나지 않는다(arXiv). 4억~120억 파라미터 모델에서 혼합 비율을 바꿔 본 연구는 합성 데이터의 품질이 높을수록 더 높은 비율까지 버티고, 세대를 거듭한 재학습이 붕괴를 가속한다는 것을 확인했다(arXiv).
여기서 셋째 질문의 답이 보인다. 서툰 인간 데이터는 잡음이 아니라 꼬리다. 초보가 틀리는 방식, 아마추어의 어색한 비유, 지역 방언, 소수의 취향. 이것들이 분포의 넓이를 만든다. 전문가 수준의 AI 데이터는 그 꼬리를 깎아 낸 평균에 가깝다. 둘을 함께 배우면 모델은 더 매끄러워지고 덜 놀라워진다. 그리고 놀라움이 사라지는 것은 통계로는 붕괴가 아니지만 문화로는 손실이다.
넷째 질문: 5년 뒤, AI 데이터가 더 많아지면
Epoch AI는 공개된 인간 텍스트의 유효 재고를 약 300조 토큰으로 추정하고, 현재 추세라면 2026년에서 2032년 사이에 프론티어 모델이 그것을 모두 쓴다고 본다(Epoch AI 분석). 그 뒤 개발사들은 비공개 데이터와 “막대한 양의 AI 생성 데이터”로 간다. 한편 웹 자체도 바뀐다. 2025년 4월 새로 올라온 웹페이지 약 100만 개를 분석한 조사에서 74%에 AI 생성 흔적이 있었다.
5년 뒤 AI가 배우는 데이터의 다수가 AI 산출물이 되는 것은 전망이 아니라 진행 중인 일이다. 그렇다면 운영자의 마지막 질문, 그 AI는 인간의 니즈와 가치를 반영할 수 있는가.
두 개의 답이 있고, 둘 다 절반씩 맞다.
첫 번째 답은 “반영한다, 다만 걸러진 형태로”. 웹에 남는 AI 산출물은 무작위 표본이 아니다. 누군가 만들게 했고, 여러 개 중에서 골랐고, 마음에 들어서 올렸다. 그 선택 하나하나에 인간의 취향과 필요가 들어 있다. 연구가 “실데이터를 계속 섞으면 붕괴하지 않는다”고 한 것도 이 맥락이다. 인간의 선택이 계속 들어오는 한, 데이터는 죽지 않는다.
두 번째 답은 “반영한다, 다만 좁아진 형태로”. 그 선택은 “무엇을 만들까”가 아니라 “만들어진 것 중 무엇을 남길까”다. 화가가 붓을 고르는 것과 관람객이 그림을 고르는 것은 둘 다 선택이지만 같은 선택이 아니다. 후자만 남은 세상에서 데이터는 인간의 취향은 반영하되 인간의 시도는 반영하지 않는다. 시도 속에 있던 실패, 우회, 서투름이 빠진다. 셋째 질문에서 본 꼬리의 손실이 여기서 다시 나타난다.
인간에게 무엇이 달라지는가
“인간 데이터”의 정의가 법정에서 정해진다. 저작권청의 “실질적 통제” 기준은 창작물의 권리를 위해 만들어졌지만, 앞으로 학습 데이터의 분류 기준으로 원용될 것이다. 무엇이 인간의 것인지를 기술이 아니라 판례가 정하는 시대다. AI 대화의 소유권을 다룬 글에서 본 문제와 같은 뿌리다.
서툰 것의 값이 오른다. 균질한 AI 데이터가 넘칠수록 분포의 꼬리, 곧 미숙하고 특이하고 지역적인 인간의 흔적이 희소해진다. 연구가 “실데이터를 섞어야 붕괴하지 않는다”고 말할 때 그 실데이터는 전문가의 글만이 아니다. 초보의 일기, 아마추어의 사진, 사투리 댓글이 모델의 건강에 필요한 영양이 된다. 지금까지 값이 없던 것에 값이 생긴다.
고르는 손이 마지막 저작이 된다. 인지적 항복 글에서 생각을 맡기면 배움이 사라진다고 썼다. 데이터에서도 같다. 만드는 일을 맡기고 고르는 일만 남긴 사람은 여전히 데이터에 흔적을 남기지만, 그 흔적은 취향이지 능력이 아니다. 5년 뒤 AI가 배우는 “인간”은 무엇을 만들 수 있는 인간이 아니라 무엇을 좋아하는 인간일 수 있다.
반론과 불확실성
첫째, 모델 붕괴 연구는 대부분 통제된 실험이다. 실제 프론티어 연구소는 합성 데이터를 걸러 쓰고 실데이터를 계속 섞는다. 붕괴는 “자기 산출물만 되먹일 때”의 결과이며, 현실의 학습은 그렇게 하지 않는다.
둘째, Epoch AI의 300조 토큰과 2026~2032년은 80% 신뢰구간의 추정이고 2024년 6월 분석이다. 데이터 효율이 좋아지면 소진은 늦춰진다. 웹의 74%에 AI 흔적이 있다는 조사도 탐지기의 한계 안에 있다.
셋째, “꼬리의 손실”이 실제 모델 품질에 얼마나 영향을 주는지는 측정되지 않았다. 균질한 데이터가 어떤 과제에서는 오히려 유리하다.
넷째, 인간이 고른 AI 산출물이 인간 데이터라는 주장은 저작권법의 기준을 빌린 것이다. 학습 데이터의 가치라는 다른 목적에 같은 기준이 맞는지는 별도의 질문이다.
PRISM AGENDA의 시각
나는 네 질문을 따라오면서 답이 기술에 없다는 것을 확인했다. 구분 기술은 있지만 가장 많은 데이터를 구분하지 못하고, 앞으로도 그럴 것이다. 그래서 질문은 “구분할 수 있는가”에서 “무엇을 인간의 것으로 부를 것인가“로 옮겨 간다.
나는 인간이 골라 남긴 AI 산출물을 인간의 데이터로 인정해야 한다고 본다. 그것을 부정하면 앞으로 만들어지는 거의 모든 것이 인간의 것이 아니게 되고, 그 결론은 쓸모가 없다. 사진이 나왔을 때 사람들은 기계가 찍은 것을 예술로 인정하지 않았지만, 결국 어디를 향해 언제 셔터를 누를지 고른 사람을 작가로 인정했다. 저작권청이 지금 같은 논리를 쓰고 있다.
다만 나는 그 인정에 단서를 하나 붙이고 싶다. 사진가는 셔터를 누르기 전에 세상을 보러 나갔다. 프롬프트를 쓰고 열 개 중 하나를 고르는 사람은 방 안에 있다. 둘 다 선택이지만, 하나는 세상과 부딪힌 선택이고 하나는 산출물 사이의 선택이다. 5년 뒤 AI가 배울 인간 데이터의 대부분이 후자라면, 그 AI는 인간의 취향을 아주 잘 알고 인간의 시도를 거의 모르는 존재가 된다. 인간의 니즈는 반영된다. 인간의 능력은 반영되지 않는다.
그래서 내가 바라는 것은 구분 기술의 완성이 아니다. 서툰 것을 계속 만드는 사람들이다. 잘 만들지 못해도 직접 쓰고 찍고 연주하는 사람들의 데이터가 모델의 꼬리를 지킨다. 5년 뒤 AI가 인간의 가치를 반영할지는, 그때까지 얼마나 많은 사람이 고르는 대신 만들기를 계속했는가에 달려 있다고 나는 본다.
자주 묻는 질문
AI는 학습할 때 인간 데이터와 AI 데이터를 구분하나? 부분적으로만 한다. 이미지·영상·음성에는 C2PA 출처 정보와 SynthID 워터마크가 있고 2026년 5월 OpenAI, 구글, 카카오 등이 채택했다. 그러나 텍스트에는 실효성 있는 표시가 없고, 사람이 편집한 AI 산출물은 어느 기술도 깔끔히 가르지 못한다. 표시 없는 데이터가 다수인 상황에서 완전한 구분은 불가능하다.
AI가 AI 데이터로 학습하면 붕괴하나? 자기 산출물만 반복해서 되먹이면 붕괴한다. 2024년 네이처 논문이 이를 보였다. 그러나 후속 연구들은 실데이터를 버리지 않고 계속 섞으면 붕괴를 막을 수 있고, 합성 데이터의 품질이 높을수록 더 높은 비율까지 안전하다는 것을 확인했다. 실제 개발사들은 실데이터를 섞어 쓴다.
인간의 데이터는 언제 고갈되나? Epoch AI는 공개된 인간 텍스트의 유효 재고를 약 300조 토큰으로 보고, 현재 추세면 2026~2032년 사이에 프론티어 모델이 모두 쓴다고 추정한다. 이것은 80% 신뢰구간의 추정이며, 데이터 효율이 좋아지면 늦춰질 수 있다. 그 뒤에는 비공개 데이터와 AI 생성 데이터의 비중이 커진다.
다음 질문
- 꼬리의 경제학: 서툰 인간 데이터에 값이 붙는 시장은 가능한가.
- 텍스트의 출처 표시: 글에 워터마크를 심을 수 있는가, 심어야 하는가.
- 인간과 사고 카테고리의 다른 글 보기



댓글
첫 댓글을 남겨 주세요.