인간과 사고 · 12 min read

인지적 항복: AI에 생각을 맡기면 배움은 어디로 가나

MIT 보고서가 경고한 인지적 항복. AI는 과제 점수를 올리지만 혼자 푸는 힘은 줄인다. 연구 5편으로 따져 본다.

에메랄드 그린 듀오톤 동판화풍 옛 대학 열람실에서 한 학생이 흰 깃발을 들고, 곁에 선 태엽 자동인형이 핫핑크로 빛나는 깃펜으로 그의 공책에 답을 대신 적는 팝아트 판화

핵심 요약

  • MIT 교내 AI 위원회는 2026년 8월 보고서에서 챗봇 과의존이 비판적 사고·기억·자신감·숙달을 약하게 만든다는 "초기 신호"가 있다고 경고하고, 이를 '인지적 항복'이라 불렀다(2026년 9월 보도).
  • 미국·영국 연구진의 무작위 실험(1,222명)에서 AI 도움을 약 10분 받은 사람은 AI를 뺀 뒤 분수 문제 정답률이 57%로, 처음부터 혼자 푼 사람(73%)보다 낮았고 포기도 더 많았다.
  • 중국 중고생 2만6,000여 명을 30개월 추적한 연구에서는 AI로 숙제 점수가 18% 올랐지만 시험 점수는 20% 떨어졌다. 다만 AI를 답 대신 풀이 도우미로 쓴 학생들은 성적이 유지됐다.

마감 전날 밤, 과제가 막힌다. 입력창에 문제를 붙여 넣으면 10초 만에 깔끔한 풀이가 돌아온다. 제출한 과제는 좋은 점수를 받는다. 그런데 일주일 뒤 시험장에서 같은 유형의 문제를 만나면 손이 움직이지 않는다. 풀었던 것은 내가 아니었기 때문이다.

미국 MIT가 올해 이 장면에 이름을 붙였다. 인지적 항복(cognitive surrender)이다. 어려운 순간마다 생각하는 과정을 AI에 넘기고, AI가 낸 답을 내가 아는 것으로 착각하는 상태를 말한다. AI 에이전트를 다룬 글은 “모두가 관리자가 되는 조직에서 신입은 무엇을 배우는가”라는 질문으로 끝났다. 이 글은 그 질문의 앞부분, 곧 AI와 함께 배우는 사람에게 실제로 무엇이 남는지를 연구 결과로 따져 본다.

무슨 일이 있었나: 점수는 오르고, 혼자 푸는 힘은 줄었다

MIT가 교내에서 경고를 냈다. MIT는 2026년 1월 에릭 클로퍼·새뮤얼 매든 교수가 공동위원장을 맡은 교육·학습·연구훈련 AI 활용 위원회를 꾸렸다. 이 위원회가 8월에 낸 보고서는 9월 중순 뉴욕타임스 보도로 알려졌다. 보고서는 챗봇 과의존이 비판적 사고 저하, 기억 약화, 자신감 하락, 숙달 저해로 이어진다는 초기 신호가 있다고 적었다. 학생들이 조금만 막혀도 AI를 찾으면서 ’배우고 있다는 착각’이 생기고, 교수 면담과 함께 공부하는 문화도 줄었다고 지적했다. 학생들은 마감을 놓칠까 두려울 때 유혹이 가장 컸다고 답했다. 국내에서도 9월 16일 여러 매체가 이 보고서를 전했다.

10분이면 충분했다. 카네기멜런대·옥스퍼드대·MIT·UCLA 연구진은 온라인 참가자 1,222명을 대상으로 무작위 실험 세 번을 했다. 한 집단은 AI의 도움을 받으며 문제를 풀다가 중간에 AI가 사라졌고, 다른 집단은 처음부터 혼자 풀었다. AI를 쓰다가 혼자가 된 사람들은 정답률이 낮았고 문제를 건너뛰는 비율도 높았다. 연구진은 이 효과가 약 10분의 AI 사용만으로 나타났다고 보고했다.

실험 대상(최종 표본) AI 사용 후 혼자 풀 때 정답률 처음부터 혼자 푼 집단 정답률 건너뛴 비율(AI 쪽 / 혼자 쪽)
1. 분수 문제 온라인 참가자 307명(AI 185, 대조 122) 57% 73% 20% / 11%
2. 분수 문제(재현) 온라인 참가자 585명(AI 308, 대조 277) 71% 77% 공개 요약에 없음
3. 독해 온라인 참가자 168명(AI 85, 대조 83) 76% 89% 8% / 1%

출처: Liu 외, arXiv:2604.04721(v4, 2026년 8월). 동료 심사 전 논문이다.

현장에서도 같은 모양이 나왔다. 스톡홀름대와 홍콩대 연구진은 중국 중부의 한 현에서 중고생 2만6,000여 명을 2022년 9월부터 30개월 동안 추적했다. AI를 쓴 학생들의 숙제 점수는 18% 올랐지만 월례 시험 점수는 20% 떨어졌고, 그 효과가 온전히 드러나기까지 약 2년이 걸렸다. 같은 보도에 따르면 AI 이용 학생의 약 81%는 답을 그대로 받아 숙제를 끝냈고, 나머지 약 19%는 AI를 풀이를 돕는 과외 교사처럼 썼다. 뒤쪽 학생들은 숙제 시간이 비이용자와 비슷했고 시험 성적도 유지됐다.

직장인도 예외가 아니다. 앤트로픽은 2026년 1월, 파이썬 경력 1년 이상인 주니어 개발자 52명에게 처음 보는 라이브러리를 익히게 하는 실험 결과를 냈다. AI를 쓴 집단의 이해도 퀴즈 점수는 평균 50%로 손으로 코딩한 집단(67%)보다 낮았다. 작업 속도는 약 2분 빨랐지만 통계적으로 의미 있는 차이는 아니었다. 점수 차이가 가장 컸던 영역은 디버깅, 곧 남이 쓴 코드의 잘못을 찾아내는 능력이었다.

왜 중요한가: 계산기와는 무엇이 다른가

인지 오프로딩은 생각의 일부를 도구나 환경에 맡기는 것을 말한다. 사람은 늘 이렇게 해 왔다. 전화번호는 휴대전화가, 길은 내비게이션이, 곱셈은 계산기가 기억한다. 그러니 AI도 또 하나의 계산기일 뿐이라는 반응이 자연스럽다.

차이는 맡기는 범위에 있다. 계산기는 답을 구하는 절차 하나를 대신하지만, 문제를 어떻게 세울지는 여전히 사람이 정한다. 생성형 AI는 문제를 읽고, 방법을 고르고, 답을 쓰고, 설명까지 붙인다. 생각의 처음부터 끝까지를 한 번에 가져갈 수 있다. 그래서 연구자들은 오프로딩을 한 덩어리로 보지 않고 둘로 나누기 시작했다.

2026년 7월 학술지 프런티어스 인 사이콜로지에 실린 연구는 대학생과 사회 초년생 589명을 2주 간격으로 세 번 조사했다. AI에 핵심 사고를 통째로 넘기는 의존형 오프로딩은 ’생각의 주도권이 AI로 넘어갔다’는 느낌을 키웠고(β=0.35) 내적 동기를 낮췄다(β=−0.23). 반면 내 생각을 유지한 채 AI를 발판으로 쓰는 자율형 오프로딩은 주도권 이전과 관계가 없었고 내적 동기를 높였다(β=0.28). 두 방식 모두 당장의 효율은 비슷했지만 이후의 창의성·깊은 처리·독립적 판단과는 반대 방향으로 연결됐다.

앞의 연구들을 이 두 갈래로 다시 정리하면 그림이 선명해진다.

연구 대상(표본) ‘답을 받은’ 쪽의 결과 ‘과정을 지킨’ 쪽의 결과
중국 중고생 추적(2026.7 보도) 중고생 2만6,000여 명, 30개월 숙제 +18%, 시험 −20% AI를 과외 교사처럼 쓴 약 19%는 시험 성적 유지
앤트로픽 코딩 실험(2026.1) 주니어 개발자 52명 이해도 퀴즈 50%(수기 집단 67%) 개념만 묻거나 설명을 함께 요청한 참가자(12명)는 평균 65% 이상, 코드를 통째로 맡긴 참가자(4명)는 40% 미만(회사 측 분석)
프런티어스 3차 조사(2026.7) 대학생·사회 초년생 589명 동기 하락, 주도권 이전 동기 상승, 주도권 유지

AI 사용 여부보다 AI에게 무엇을 맡겼느냐가 결과를 가른다는 뜻이다.

인간에게 무엇이 달라지는가

점수와 실력이 갈라진다. 지금까지 과제 점수는 실력의 대리 지표였다. 잘 쓴 보고서는 잘 생각한 사람의 흔적이었다. AI가 들어오면서 이 연결이 끊어지고 있다. 중국 연구의 숙제 +18%와 시험 −20%는 같은 학생들에게서 나온 숫자다. 학교든 회사든 결과물만 보고 사람을 평가하는 방식은 점점 틀린 답을 낼 가능성이 크다.

내가 한 일과 AI가 한 일의 경계가 흐려진다. 독일·핀란드 연구진이 184명을 대상으로 한 실험에서는 AI와 함께 아이디어를 내고 글을 다듬은 뒤 일주일이 지나자 무엇이 내 생각이고 무엇이 AI의 것이었는지 기억하는 정확도가 떨어졌다. 사람과 AI가 섞여 작업한 경우에 가장 크게 떨어졌다. 9월 17일 공개된 브라운대 등의 조사는 이 문제를 다른 쪽에서 본다. 사람들은 AI 결과를 직접 이끌고 고쳐 쓴 작업은 자기 것으로 느꼈지만, 제안을 승인만 한 작업은 자기 것으로 느끼지 않았다. 승인만 하는 일이 늘수록 일에서 느끼는 주인 의식도 줄어든다.

AI를 믿을수록 덜 따진다. 마이크로소프트 리서치와 카네기멜런대가 지식노동자 319명을 조사한 연구는 AI에 대한 신뢰가 높을수록 비판적 사고를 덜 하고, 자기 능력에 대한 확신이 높을수록 더 한다는 경향을 보고했다. 문제는 순환이다. 혼자 푸는 경험이 줄면 자기 확신이 줄고, 자기 확신이 줄면 AI를 더 믿고, AI를 더 믿으면 덜 따진다.

신입의 사다리가 안쪽에서 무너진다. AI 시대 ’인간의 일’을 정리한 글에서 진입 일자리가 먼저 줄어든다는 데이터를 봤다. 인지적 항복은 같은 문제의 안쪽 면이다. 일자리가 남아 있어도, 신입이 그 자리에서 실력을 쌓지 못하면 사다리는 없는 것과 같다. 앤트로픽 실험에서 가장 크게 벌어진 능력이 디버깅이었다는 점은 뼈아프다. AI가 쓴 결과물을 검토하는 것이 앞으로 사람의 핵심 업무가 될 텐데, 바로 그 능력이 AI와 함께 배울 때 가장 덜 자란다.

반론과 불확실성

첫째, 연구 대부분이 짧거나 인위적이다. 무작위 실험은 10분에서 1시간 남짓의 과제였고, 사람들이 몇 달에 걸쳐 AI 쓰는 법을 익히면 결과가 달라질 수 있다. 중국 연구는 장기 추적이지만 무작위 배정이 아니어서, AI를 많이 쓴 학생이 원래 학습 동기가 낮았을 가능성을 완전히 배제하기 어렵다. 이 연구는 학술지 게재 전 단계로 보도됐다.

둘째, 시험이 ’AI 없는 상태’를 측정한다는 점 자체가 시대에 뒤처졌다는 주장도 있다. 앞으로 사람은 늘 AI와 함께 일할 텐데, AI 없이 푸는 능력이 왜 중요하냐는 것이다. 설득력 있는 지적이지만, AI가 틀렸을 때 그것을 알아채는 힘은 결국 혼자 풀어 본 경험에서 나온다. 계산기를 쓰는 사람도 답이 터무니없으면 알아챈다. 그 감각이 없다면 AI와 함께 일하는 것이 아니라 AI를 따라 일하는 것이다.

셋째, 효과의 크기도 연구마다 다르다. 같은 분수 실험을 재현한 두 번째 실험에서는 차이가 6%포인트로 줄었다. 인지적 항복이 모든 사람에게 같은 크기로 일어난다고 말하기는 이르다.

PRISM AGENDA의 시각

우리는 이 연구들이 말하는 것이 ’AI를 쓰지 말라’가 아니라 ’과정을 넘기지 말라’라고 본다. 중국 학생 19%와 프런티어스 연구의 자율형 오프로딩이 보여 주듯, 같은 도구로도 실력을 지킨 사람들이 있었다. 차이는 첫 생각을 누가 했느냐였다.

그래서 개인과 조직이 스스로 점검할 수 있는 기준을 제안한다.

점검 항목(PRISM AGENDA 제안) 정의 관찰 지표 한계
첫 초안은 사람 AI를 부르기 전에 내 답이나 방향을 먼저 적는다 AI 사용 전 메모·가설의 존재 급한 업무에서는 지키기 어렵다
설명할 수 있나 AI가 낸 결과를 AI 없이 남에게 설명할 수 있다 구두 설명·코드 리뷰 통과 여부 설명 능력과 실제 능력은 다를 수 있다
가끔은 혼자 주기적으로 AI 없이 같은 종류의 일을 해 본다 AI 없는 과제·연습의 빈도 효율 손실을 감수해야 한다
고쳐 쓴 흔적 승인만 하지 않고 이끌고 고친다 AI 결과 대비 수정 비율 수정량이 곧 사고의 양은 아니다

조직에도 요구할 것이 있다. 신입에게 AI를 쥐여 주고 속도로만 평가하면, 몇 년 뒤 AI의 실수를 잡아낼 선배가 남지 않는다. 학습 기간에는 결과물보다 과정을 보는 평가가 필요하다. AI가 생각을 대신하는 시대일수록, 생각하는 연습은 누군가 일부러 지켜 줘야 하는 자원이 된다.

자주 묻는 질문

인지적 항복(cognitive surrender)이란 무엇인가? 어려운 문제를 만날 때마다 생각하는 과정을 AI에 넘기고, AI가 낸 답을 스스로 아는 것으로 착각하는 상태를 말한다. MIT 교내 AI 위원회가 2026년 보고서에서 이 표현을 썼고, 챗봇 과의존이 비판적 사고·기억·자신감·숙달을 약하게 할 수 있다는 초기 신호가 있다고 경고했다.

AI를 쓰면 정말 공부 실력이 떨어지나? 쓰는 방식에 따라 다르다. 중국 중고생 2만6,000여 명을 추적한 연구에서 AI로 답을 받아 숙제를 한 학생들은 시험 점수가 20% 떨어졌지만, AI를 풀이 도우미로 쓴 약 19%는 성적이 유지됐다. 답을 받는 것과 과정을 돕게 하는 것은 결과가 다르다.

AI에 의존하지 않고 쓰는 방법은? AI에 묻기 전에 내 답이나 방향을 먼저 적어 보고, AI의 결과를 AI 없이 설명할 수 있는지 확인하는 것이 출발점이다. 연구들은 AI의 제안을 승인만 할 때보다 직접 이끌고 고쳐 쓸 때 실력과 주인 의식이 함께 유지된다고 보고한다.

다음 질문