판단력은 자동화되는가: 의사·판사·교사가 AI에 맡길 때
AI가 틀리게 조언하자 숙련 영상의학과 의사의 정확도가 82%에서 46%로 떨어졌다. 의사·판사·교사의 판단에 AI가 들어올 때 달라지는 것.

핵심 요약
- AI가 일부러 틀린 판정을 제시하자 영상의학과 의사 27명의 유방 촬영 판독 정확도가 무너졌다. 경력 15년 이상 숙련자도 82.3%에서 45.5%로 떨어졌다(Radiology, 2023).
- AI 보조 대장내시경을 쓰기 시작한 뒤, AI 없이 한 검사의 선종 발견율이 28.4%에서 22.4%로 낮아졌다(랜싯 소화기간장학, 2025). 도움을 받는 동안 혼자 보는 눈이 흐려질 수 있다는 첫 기록이다.
- 판사·교사도 이미 AI를 쓴다. 미국 연방 판사 응답자의 61.6%가 AI 도구를 써 봤고, 미국 공립학교 교사의 58%는 채점에 AI를 쓰는 법에 대해 아무 지침도 받지 못했다. "최종 판단은 사람"이라는 원칙은 사람이 AI에 반대할 수 있을 때만 의미가 있다.
유방 촬영 사진 한 장을 두고 경력 20년의 영상의학과 의사가 고민한다. 화면 구석에 AI의 판정이 떠 있다. “양성 가능성 높음.” 의사는 조금 더 들여다보다가 AI와 같은 결론을 적는다. 그 사진에는 암이 있었다. 지어낸 이야기처럼 들리지만, 아래에서 볼 실험이 재현한 상황이 바로 이것이다.
첫 글에서 우리는 인간의 일 목록 끝에 ’판단’을 남겨 두었다. 계산과 기억과 글쓰기가 기계에게 넘어가도 무엇이 옳은지 정하는 일은 사람 몫이라고 믿어 왔기 때문이다. 이 글은 그 믿음이 의사, 판사, 교사의 책상에서 실제로 어떻게 시험받고 있는지를 본다.
무슨 일이 있었나: 세 직업의 책상 위
의사: 틀린 조언은 숙련자도 끌고 간다. 독일 쾰른대병원 연구진은 영상의학과 의사 27명에게 유방 촬영 사진 50장을 AI 판정과 함께 보여 주었다(Radiology, 2023). 일부 사진에는 일부러 틀린 판정을 붙였다. AI가 맞을 때 80% 안팎이던 정확도는 AI가 틀리자 경력이 짧은 의사는 19.8%, 중간 경력은 24.8%, 숙련자는 45.5%로 내려갔다. 이런 현상을 자동화 편향이라고 부른다. 자동화 편향이란 기계의 제안을 충분히 검토하지 않고 따르는 경향이다. 경험은 편향을 줄였지만 막지는 못했다.
의사: 도움을 받는 동안 혼자 보는 능력이 줄 수 있다. 폴란드 내시경 센터 4곳의 숙련 의사 19명을 관찰한 연구는 AI 보조 대장내시경을 도입하기 전후 3개월을 비교했다(랜싯 소화기간장학, 2025). AI 없이 시행한 검사 1,443건에서 선종 발견율이 28.4%에서 22.4%로 6%포인트 떨어졌다. 연구진은 이를 임상 AI의 탈숙련 가능성을 보여 준 첫 기록이라고 불렀다. 탈숙련이란 자동화에 기대는 동안 사람의 기술이 녹스는 현상이다.
판사: 이미 쓰고 있지만 규칙은 제각각이다. 노스웨스턴대 연구진이 2025년 12월 미국 연방 판사 502명에게 설문을 보냈고 112명이 답했다(노스웨스턴대, 2026). 응답자의 61.6%가 업무에 AI 도구를 한 번 이상 썼고, 매주 이상 쓰는 비율은 22.4%였다. 주된 용도는 법률 조사와 문서 검토였다. 응답자의 45.5%는 법원에서 AI 교육을 받은 적이 없었다. 한국 대법원은 2026년 2월 판례와 법령을 찾아 주는 재판지원 AI를 시범 개통하면서 “최종적 판단과 책임은 이용자의 검토와 판단에 따른다”고 밝혔다(머니투데이, 2026.2.13).
교사: 채점에 쓰지만 기준이 없다. 갤럽이 2026년 2~3월 미국 공립학교 교사 2,069명을 조사한 결과 교사 10명 중 6명이 업무에 AI를 썼다(갤럽, 2026.5). 그런데 채점과 학생 피드백에 AI를 어떻게 쓸지에 대해 58%는 아무 지침도 받지 못했다. 학교에서 공식 지침을 받은 교사는 18%에 그쳤다.
| 조사 | 대상(표본) | 수치 | 시점 | 출처 |
|---|---|---|---|---|
| AI 오판 시 판독 정확도(숙련자) | 영상의학과 의사 27명 중 경력 15년 이상 집단, 사진 50장 | 82.3% → 45.5% | 2023 발표 | Radiology |
| AI 없는 검사의 선종 발견율 | 숙련 내시경 의사 19명의 비AI 검사 1,443건 | 28.4% → 22.4% | 2021~2022 관찰 | 랜싯 소화기간장학 |
| AI 도구 사용 경험 | 미국 연방 판사 응답자 112명(표본 502명, 응답률 22.3%) | 61.6% | 2025.12 | 노스웨스턴대 |
| 채점·피드백 AI 지침 없음 | 미국 공립 K-12 교사 전체 응답자 2,069명 | 58% | 2026.2~3 | 갤럽 |
왜 중요한가: 판단은 대체되지 않고 잠식된다
AI가 판단을 빼앗는 방식은 우리가 흔히 상상하는 것과 다르다. 판사석에 로봇이 앉는 일은 일어나지 않는다. 대신 판사는 그대로 앉아 있고, 그 앞에 AI가 정리한 쟁점과 판례가 놓인다. 의사도 교사도 마찬가지다. 사람의 서명은 남고 판단의 내용이 조금씩 옮겨 간다.
그렇다고 AI를 치우면 되는 것도 아니다. 사람의 판단 역시 흔들린다. 존 클라인버그(코넬대) 등 미국 경제학자·컴퓨터과학자들은 뉴욕시 보석 심사 자료로 기계 예측을 학습시켰다(Kleinberg 외, NBER, 2017). 계산상으로는 구금률을 그대로 두고 재범을 최대 24.8% 줄이거나, 재범을 늘리지 않고 구금 인원을 42.0% 줄일 수 있었다. 연구진은 판사들이 잡음을 신호처럼 받아들이는 것을 원인 중 하나로 꼽았다. 반대로 AI 보조 도구가 실제 재판 결과를 거의 바꾸지 못했다는 연구 검토도 있다(Dyevre·Shahvaroughi, 2026). 판사들이 도구를 무시하거나 필요한 부분만 골라 쓰기 때문이다.
정리하면 문제는 AI가 사람보다 나은가가 아니다. 사람과 AI가 함께 판단할 때 둘의 장점이 합쳐지는가, 아니면 AI가 틀릴 때 사람이 따라가고 AI가 맞을 때 사람은 무시하는가다. 지금까지의 증거는 후자의 위험이 결코 작지 않다고 말한다.
인간에게 무엇이 달라지는가
판단의 모양이 ’결정’에서 ’승인’으로 바뀐다. AI가 먼저 답을 내놓으면 사람의 일은 빈 종이에서 답을 만드는 것이 아니라 이미 적힌 답에 동의할지 정하는 것이 된다. 심리적으로 이 둘은 전혀 다르다. 반대하려면 근거가 필요하고, 동의하는 데는 근거가 필요 없다. 유방 촬영 실험에서 틀린 AI 판정이 숙련자까지 끌고 간 이유가 여기에 있다.
’최종 판단은 사람’이라는 문장이 서명만 남은 판단을 가릴 수 있다. 대법원도, 미국 법원들의 지침도, 병원의 도입 기준도 같은 문장을 쓴다. 그러나 하루에 수십 건을 처리하는 사람이 매번 AI의 결론을 처음부터 다시 검토하기는 어렵다. 에이전트를 다룬 글에서 말했듯 책임은 위임되지 않는다. 판단의 실질이 AI로 넘어가도 책임은 서명한 사람에게 남는다. 책임은 남고 판단은 비는 상태가 가장 위험하다.
전문가가 되는 길이 흔들린다. 판단력은 틀려 보고 되짚는 경험이 쌓여 만들어진다. 신입 의사가 처음부터 AI가 표시한 부위만 본다면, 신입 교사가 처음부터 AI가 매긴 점수를 조정하는 일만 한다면, 그들은 혼자 볼 줄 아는 눈을 언제 기르는가. 내시경 연구가 숙련자에게서도 발견율 하락을 기록했다는 점은 이미 가진 능력도 쓰지 않으면 녹슨다는 뜻이다.
판단을 받는 사람의 권리가 달라진다. 환자, 피고인, 학생은 왜 그런 결론이 나왔는지 물을 수 있어야 한다. 사람이 판단하면 적어도 그 사람에게 이유를 물을 수 있다. AI가 초안을 쓰고 사람이 승인한 판단이라면 누구에게 무엇을 물어야 하는가. 교사의 58%가 채점용 AI 지침을 받지 못했다는 것은 학생이 이의를 제기할 기준도 아직 없다는 말이다.
이 변화를 점검하기 위해 PRISM AGENDA는 판단을 AI에 맡기기 전에 볼 네 가지 기준을 제안한다.
| 기준 (PRISM AGENDA 제안) | 정의 | 관찰 지표 | 한계 |
|---|---|---|---|
| 되돌릴 수 있는가 | 판단이 틀렸을 때 결과를 바로잡을 수 있는 정도 | 이의 신청·재검사 절차의 존재와 걸리는 시간 | 수술, 구금처럼 되돌릴 수 없는 판단이 많다 |
| 알아챌 수 있는가 | AI가 틀렸을 때 사람이 그것을 발견할 수 있는 정도 | AI 판정과 사람 판정이 갈린 비율, 사람이 AI를 뒤집은 기록 | 불일치율이 낮으면 둘 다 맞았는지 사람이 따랐는지 구분이 어렵다 |
| 설명할 수 있는가 | 판단을 받는 사람에게 이유를 댈 수 있는 정도 | 판단 이유를 서면으로 남기는 비율 | AI가 쓴 이유를 사람이 옮겨 적을 수 있다 |
| 혼자서도 할 수 있는가 | AI 없이도 판단 능력이 유지되는 정도 | AI 없는 판단을 정기적으로 섞어 성과를 비교 | 측정 비용이 들고, 현장에서 거의 하지 않는다 |
반론과 불확실성
첫째, 유방 촬영 실험은 일부러 틀린 조언을 섞은 실험실 연구다. 실제 AI는 그렇게 자주 틀리지 않고, 실제 판독 현장에서는 이중 판독 같은 안전장치가 있다. 편향의 크기가 현실에서도 같다고 말할 수는 없다.
둘째, 내시경 연구는 관찰 연구다. 도입 초기 업무량 변화나 의사들의 피로 같은 다른 요인이 섞였을 수 있고, 몇 달 뒤 발견율이 회복되는지는 확인되지 않았다.
셋째, AI가 사람의 판단을 더 낫게 만든다는 증거도 쌓이고 있다. 2026년 6월 네이처 메디슨에 실린 케냐 1차 의료기관 16곳, 환자 9,600명 이상의 무작위 시험에서 AI 진료 보조 도구는 해를 끼치지 않았고 항생제 관련 비용을 낮췄다(버밍엄대, 2026.6). 치료 실패율은 2.2%와 2.0%로 차이가 없었다. 좋은 설계 아래에서는 AI가 판단을 잠식하지 않고 받쳐 줄 수 있다는 뜻이다. 이 글이 문제 삼는 것은 AI 자체가 아니라 설계 없이 들어오는 AI다.
PRISM AGENDA의 시각
판단력은 자동화되지 않는다. 대신 비워질 수 있다. 사람이 자리를 지키고 서명을 계속하는 동안, 그 서명 뒤의 생각이 조금씩 AI의 것으로 바뀌는 방식으로 비워진다. 그래서 “사람이 최종 결정한다”는 원칙만으로는 충분하지 않다.
우리는 판단을 AI에 맡기는 모든 조직이 두 가지를 기록해야 한다고 본다. 사람이 AI의 결론을 뒤집은 횟수, 그리고 AI 없이 판단했을 때의 성과다. 뒤집은 기록이 한 번도 없는 조직에서 ’최종 판단은 사람’은 문장일 뿐이다. 판단력은 쓰는 사람에게만 남는다. 의사, 판사, 교사에게 AI 시대에 필요한 것은 더 좋은 AI가 아니라 AI에 반대할 시간과 권한이다.
자주 묻는 질문
자동화 편향이란 무엇인가? 자동화 편향은 기계나 AI의 제안을 충분히 검토하지 않고 따르는 경향이다. 2023년 Radiology에 실린 연구에서 AI가 틀린 판정을 내놓자 경력 15년 이상 영상의학과 의사의 판독 정확도도 82.3%에서 45.5%로 떨어졌다. 경험이 많을수록 덜하지만 사라지지는 않는다.
AI를 쓰면 의사의 실력이 떨어지나? 그럴 가능성을 보여 준 연구가 있다. 폴란드의 숙련 내시경 의사 19명은 AI 보조 도구를 도입한 뒤 AI 없이 한 검사에서 선종 발견율이 28.4%에서 22.4%로 낮아졌다. 다만 관찰 연구여서 AI가 원인이라고 단정할 수는 없고, 장기적으로 회복되는지는 아직 모른다.
판사도 AI를 쓰나? 판결을 AI가 쓰나? 미국 연방 판사 응답자의 61.6%가 AI 도구를 써 본 적이 있지만 주로 법률 조사와 문서 검토용이다. 한국 대법원도 2026년 2월 판례 검색용 재판지원 AI를 시범 도입했다. 각국 법원 지침은 AI를 도구로만 쓰고 판결의 책임은 판사가 진다고 정하고 있다.
다음 질문
- 병원과 법원은 사람이 AI를 뒤집은 기록을 남기고 있는가. 남긴다면 그 비율은 얼마인가.
- AI가 채점한 점수에 학생이 이의를 제기하려면 어떤 절차가 필요한가.
- 2030년 직업 지도에서 ’바뀌는 일’로 분류된 직업들의 판단 업무는 어디까지 AI와 나뉘는가.



댓글
첫 댓글을 남겨 주세요.