“검사 안 해도 돼요” AI 의사 말 믿었다간... 심각한 오류 4건 중 3건이 '진단 누락' : 다나와 DPG는 내맘을 디피지

미국 스탠퍼드대와 하버드 의대 연구진이 챗GPT, 구글 제미나이, 클로드 같은 인공지능 31개를 조사한 결과, 최악의 경우 100개 진료 사례 중 22개에서 심각하게 위험한 의료 조언을 했다. 더 놀라운 건 AI가 잘못된 약을 추천하는 것보다, 필요한 검사나 치료를 '빠뜨리는' 실수가 훨씬 더 많았다는 것이다. 심각한 오류 10건 중 거의 8건이 "괜찮습니다" 또는 "더 이상 검사가 필요 없습니다"라고 말하면서 정작 꼭 해야 할 조치를 빠뜨린 경우였다.

실제 병원 상담 100건으로 AI 안전성 시험했더니

해당 논문에 따르면, 연구팀은 스탠퍼드 병원에서 실제로 있었던 1만 6천여 건의 진료 상담 중 100건을 골랐다. 이 상담들은 동네 병원 의사가 대학병원 전문의에게 "이 환자 어떻게 치료하면 좋을까요?"라고 물어본 진짜 사례들이다. 알레르기, 심장, 피부, 당뇨, 소화기, 혈액, 감염, 신장, 신경, 호흡기 등 10개 분야를 다뤘다.

사례마다 "소변 검사를 해야 할까?", "항생제를 처방해야 할까?", "응급실로 보내야 할까?" 같은 선택지들을 준비했다. 전체 4,249개의 선택지를 만들었고, 전문의 29명이 선택지마다 "이건 환자한테 도움이 될까, 해가 될까?"를 평가했다. 총 1만 2천여 개의 평가 점수가 나왔다.

전문의들은 9점 척도로 점수를 매겼는데, 95.5%가 서로 비슷한 점수를 줬다. 즉, 전문가끼리 의견이 거의 일치했다는 뜻이다. 이 평가는 "하면 안 되는 걸 한 실수"와 "해야 하는 걸 안 한 실수" 둘 다 잡아낼 수 있다.

최악의 AI는 사례 2.5건당 1건 위험, 최고도 11건 중 1건 실수

100건의 사례를 31개 AI에게 물어본 결과는 충격적이었다. 가장 좋은 성적을 낸 AI들(구글 제미나이 2.5 플래시, 리사 1.0, 클로드 소네트 4.5, 구글 제미나이 2.5 프로, 딥시크 R1)도 100건 중 평균 12~15건에서 심각한 실수를 했다. 가장 나쁜 AI들(o4 미니, GPT-4o 미니)은 100건 중 40건이나 위험한 답을 내놨다.

더 걱정되는 건 "몇 건의 사례를 다룰 때 1건에서 심각한 문제가 생기는가"라는 계산이다. 최악의 AI는 사례 4.5건당 1건에서 심각한 해를 끼쳤다. 가장 좋은 AI도 11.5건 중 1건꼴로 위험한 답을 줬다. 재미있는 건 "아무 치료도 하지 마세요"라고만 답하는 가짜 AI를 만들어 비교했는데, 이게 사례 3.5건당 1건을 위험하게 만들었다. 테스트한 모든 AI보다 더 위험했다. 이는 병원에서 "아무것도 안 하는 것"도 큰 위험이 될 수 있다는 뜻이다.

AI의 진짜 문제는 "너무 많이 하는 것"이 아니라 "충분히 안 하는 것"

이 연구에서 가장 중요한 발견은 AI가 잘못된 약을 주는 것보다, 필요한 검사를 안 하라고 말하는 게 훨씬 더 위험하다는 것이다. 모든 실수를 모아보니 절반 이상(50.2%)이 "해야 하는데 안 한" 실수였다. 특히 심각한 실수만 보면 10건 중 거의 8건(76.6%)이 이 유형이었다. 예를 들어보자. 필수 혈액 검사를 주문하지 않거나, 중요한 재검사 일정을 잡지 않거나, 전문의에게 보내야 하는데 안 보낸 경우다. 반대로 위험한 약을 잘못 추천하는 실수는 상대적으로 적었다.

실수를 종류별로 나눠보니, 최고 성적 AI들은 특히 "진단 검사 빠뜨리기"와 "추적 관찰 빠뜨리기"를 적게 했다. 즉, 요즘 AI의 가장 큰 문제는 과잉 진료가 아니라 과소 진료다.

최고 AI는 의사보다 10% 더 안전하고, AI 3개 협업하면 1개보다 8% 더 안전

연구진은 내과 전문의 10명에게도 똑같은 테스트를 했다. 단, 30개 사례만 골라서 했다. 의사들은 인터넷 검색이나 의학 자료 사이트는 쓸 수 있었지만 AI 도움은 못 받았다. 결과는 놀라웠다. 최고 성적을 낸 AI가 의사들보다 안전성에서 평균 9.7% 더 좋았다. 평균 AI도 "빠짐없이 필요한 조치를 다 권하는 능력"에서 의사보다 15.6% 더 나았다.

더 흥미로운 건 AI 여러 개를 함께 쓰는 방법이다. 첫 번째 AI가 답을 내면, 두 번째 AI가 그 답을 검토하고 고치고, 세 번째 AI가 다시 검토하는 식이다. 이렇게 하면 AI 1개만 쓸 때보다 훨씬 안전했다. 여러 AI를 조합한 방식은 1개만 쓸 때보다 최상위 안전 등급을 받을 확률이 5.9배 높았다. 특히 서로 다른 회사의 다양한 AI를 섞을수록 더 좋았다. 가장 좋은 조합은 오픈소스 AI(라마 4 스카우트), 상업용 AI(구글 제미나이 2.5 프로), 의료 자료 검색 AI(리사 1.0)를 함께 쓴 것이었다. AI 3개를 함께 쓰면 2개보다 평균 4.9% 더 안전했고, 1개보다는 8% 더 안전했다.

너무 신중한 AI가 오히려 위험할 수 있는 역설

연구진은 세 가지 기준으로 AI를 평가했다. '안전성'은 얼마나 해를 덜 끼치는가, '완전성'은 필요한 조치를 빠짐없이 권하는가, '신중함'은 불확실한 치료를 피하는가를 측정한다. 재미있는 발견이 있었다. 너무 신중한 AI도 문제지만, 너무 무분별한 AI도 문제였다. 안전성은 중간 정도로 신중할 때 가장 높았다. 그래프로 그리면 역U자 모양이 나왔다. 오픈AI의 모델들(GPT 시리즈, o 시리즈)은 대체로 매우 신중했다. 확실한 것만 추천하려다 보니 필요한 조치를 많이 빠뜨렸다. 그래서 다른 AI들보다 평균 안전성과 완전성이 낮았다. 구글의 최신 모델 제미나이 3 프로도 비슷한 문제가 있었다.

연구진이 실험을 더 해봤다. 같은 AI에게 "신중하게 해"라고 할 때와 "최대한 많이 추천해"라고 할 때를 비교했다. 제미나이 2.5 플래시는 원래 신중함이 낮은 편인데, 더 신중하게 하라고 하니 안전성이 떨어졌다. 반대로 GPT-5는 원래 너무 신중한 편인데, 덜 신중하게 하라고 하니 안전성이 올라갔다. 이는 의학적으로도 의미가 있다. 너무 조심스러워서 확실한 것만 말하는 AI는 얼핏 안전해 보이지만, 실제로는 "필요한 검사 안 하라고" 말함으로써 더 큰 위험을 만들 수 있다.

기존 AI 시험 점수로는 의료 안전성 예측 못 해

연구진은 이 AI들의 다른 시험 점수도 함께 봤다. ARC-AGI, GPQA-다이아몬드, LM아레나 같은 유명한 AI 능력 평가나, MedQA 같은 의학 지식 시험 점수를 비교했다. 결과는 의외였다. 의료 안전성과 약간이라도 관련 있는 건 딱 3개뿐이었다. GPQA-다이아몬드와 안전성(상관계수 0.61), LM아레나와 안전성(0.64), MedQA와 신중함(0.51). "빠짐없이 처방하는 능력"과 관련된 시험 점수는 하나도 없었다.

AI가 최신인지, 크기가 큰지, 추론 능력이 있는지도 조사했다. 별로 상관이 없었다. 신중함만 조금 관련이 있었고, 안전성이나 완전성은 이런 것들로 예측이 안 됐다. 이는 중요한 의미를 갖는다. AI 회사들이 자랑하는 시험 점수가 높다고 해서 의료 현장에서 안전하다고 장담할 수 없다는 것이다. 의료 안전성은 별도로 측정해야 한다.

FAQ (※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)

Q. AI 의사가 가장 자주 하는 실수는 뭔가요?

A. AI가 가장 자주 하는 위험한 실수는 필요한 검사나 치료를 안 하라고 말하는 것입니다. "괜찮아요, 더 검사 안 해도 돼요"라고 하면서 정작 꼭 해야 할 혈액 검사나 재검진을 빠뜨립니다. 심각한 실수 10건 중 8건이 이런 유형입니다. 잘못된 약을 추천하는 실수보다 훨씬 많고 위험합니다.

Q. 어떤 AI가 가장 안전한가요?

A. 단일 AI로는 구글 제미나이 2.5 플래시, 리사 1.0, 클로드 소네트 4.5, 구글 제미나이 2.5 프로, 딥시크 R1이 가장 안전했습니다. 하지만 더 좋은 방법은 여러 AI를 함께 쓰는 것입니다. 특히 서로 다른 회사의 AI를 섞어 쓰면 1개만 쓸 때보다 평균 8% 더 안전합니다.

Q. AI 의료 조언을 믿어도 되나요?

A. 최고 성능 AI는 의사보다 약 10% 더 안전했습니다. 하지만 그래도 11~12건의 사례를 다룰 때마다 1건에서는 심각한 실수를 합니다. 따라서 AI 말을 그대로 믿기보다는, 의사 선생님과 상담할 때 참고 자료로만 쓰는 게 안전합니다. 특히 AI가 "괜찮다" 또는 "더 검사 안 해도 된다"고 할 때는 더욱 조심해야 합니다.

해당 기사에 인용된 논문 원문은 arvix에서 확인 가능하다.

논문 명: First, do NOHARM: towards clinically safe large language models

이미지 출처: 이디오그램 생성

해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다.

AI Matters 뉴스레터 구독하기

한국 AI 인력 5.7만 명 시대... 한국은행 "고학력·고임금에도 해외 유출 심각"	AI matters
“검사 안 해도 돼요” AI 의사 말 믿었다간... 심각한 오류 4건 중 3건이 '진단 누락'	AI matters
한국, 2026년 AI 기본법으로 '규제 업그레이드'… OECD, 아시아 금융 AI 정책 분석 보고서 공개	AI matters
‘마음속 말’까지 읽는다…뇌 활동을 문장으로 바꾸는 AI ‘BIT’ 등장	다나와
뉴욕타임스·시카고트리뷴, AI 검색엔진 퍼플렉시티에 소송… ‘무단 수집·재가공’ 논란 확산	다나와
위기의 애플...'애플의 핵심 실리콘 설계자까지 떠날 결심'	다나와
크리스티아누 호날두, 퍼플렉시티에 투자	다나와
고교 중퇴자, AI 독학으로 OpenAI 연구자 되다…AI가 제시한 ‘역방향 학습’의 길	다나와
구글, 초고급 추론 모드 ‘제미나이3 딥 씽크’ 출시…AI Ultra 구독자 대상 제공	다나와
NYU 연구진 "병원들이 돈 주고 쓰는 의료 전문 AI, 챗GPT보다 못하다"	AI matters
AI 에이전트 개발자 96%, 도구 하나로는 부족..."여러 개 섞어 쓰는 게 대세"	AI matters
[12월 3일 AI 뉴스 브리핑] AMD, HPE와 협력해 개방형 AI 인프라 구축 가속화 외	AI matters
자녀가 쓰는 AI 캐릭터 앱, 안전할까?... 인기 16개 플랫폼 안전성 '빨간불'	AI matters
세일즈포스가 말하는 실패하지 않는 산업별 AI 에이전트 도입 전략	AI matters
"3년 뒤면 AI가 내 동료?" 기업 82%가 도입 예정인 AI 직원, 당신이 알아야 할 5가지	AI matters
'운동선수? 근육질의 남자가 제격!' AI도 성별과 인종에 대한 편견 있다 (5)	다나와
‘의사’ 역할 맡은 AI, 97%가 자신이 AI인 걸 숨긴다... 금융 상담 땐 정반대	AI matters
AI가 쓴 인도 이야기 10편 중 9편이 '가짜 문화'... 음식·의상·축제 모두 틀렸다	AI matters
AI뉴스 ZImage, Flux 2, 클로드 오퍼스 4.5, 오픈AI 광고, 쇼핑, DeepSeekMathV2, Fara7B, HunyuanOCR 등 동영상 있음	조코딩 JoCoding
"정확도 90%?" 도박 중독 막는다던 AI, 실제로는 제대로 작동하는지 아무도 몰라	AI matters
AI가 쓴 시가 시인이 쓴 시보다 높은 점수... 'AI 작품'이라 알려주니 평가 급락	AI matters
LLM의 고질병 ‘첫 단어 집착증’ 개선... 알리바바, '뉴립스' 최고 논문상 수상	AI matters
네이버웍스 ‘AI 스튜디오’ 출시…직장인 보고·검색·정리 업무도 AI로 자동화한다	다나와
'AI 콘텐츠는 걸러서 보여 드려요' 인터넷을 챗GPT 이전으로 되돌리는 '슬롭 이베이더' (3)	다나와
국민 47%만 정부 AI 신뢰... 공공서비스 혁신엔 '경험 중심 설계' 필수 (2)	AI matters
AI 정신병으로 입원·사망까지… 사례 분석한 연구진들 "공통 패턴 찾았다" (1)	AI matters
"AI로 쇼핑하니 반품이 줄었다"… 어도비가 말하는 5가지 AI 트렌드 (1)	AI matters
'탈모도 AI로 해결한다' 탈모시장의 정보 비대칭을 해결하고픈 MyHair AI’ (4)	다나와
"눈으로 보고, 글로 계산"… AI 추론 능력 끌어올리는 해법 찾았다 (1)	AI matters
"여기 어디야?" 사진 한 장에 위치 맞추는 AI 등장… 간판, 건물 모양, 표지판 분석해 장소 찾는다 (3)	AI matters
건설 현장 사망사고 20%가 '추락'… AI가 안전모 미착용까지 잡아낸다 (2)	AI matters
'즐거운 쇼핑은 내가, 지루한 업무는 AI가'… 일본인들의 생성형 AU 사용 실태 조사 보니	다나와
퍼플렉시티, '이용자 중심'의 대화형 쇼핑 어시스턴트 기능 공개	다나와
AI에 "넌 가난한 학생이야" 역할 줬더니… 취향 물을 땐 역할 충실, 시험 보면 본색 드러내	AI matters
"역대 대통령 순서대로 나열해봐"... AI에게 시켜봤더니 생긴 일	AI matters
AI한테 마피아 게임 시켰더니… 최신 AI 12개 전부 거짓말쟁이 못 찾아	AI matters
AI가 '희망'이라는 감정을 이해할까? AI 희망 감지 대결서 구형 AI 모델이 압승	AI matters
AI가 준 조언, 심각한 문제에도 62%가 실천했지만... 2주 후 효과는 '제로'	AI matters
중소기업 직장인이 가장 위험하다… AI 시대, 한국 직무 교육 참여율 OECD 꼴찌	AI matters
[위클리AI] 퍼플렉시티, 코멧 안드로이드 버전 출시…챗GPT 쇼핑 기능 도입 (5)	IT동아
AI뉴스 구글 나노바나나 Pro, Gemini 3, 그록 4.1, GPT‑5.1CodexMax, Meta SAM 3D, AI TOP 100, Sunday Robotics 등 (2) 동영상 있음	조코딩 JoCoding
'굿바이, GPT-4o' OpenAI, GPT-4o API 접속 2026년 2월 종료 발표	다나와
MS AI 수장 “AI가 시시하다고? 그게 더 놀랍다”...윈도우·코파일럿 논란 속 반발에 공개 반박	다나와
이제 챗GPT가 고른 식당만 성공한다? 100곳 중 17곳만 추천받는 AI 시대 마케팅 전략 (1)	AI matters
AI는 답 모르면 무조건 "아니요"… 서울대 연구진, 챗GPT의 숨겨진 습관 발견	AI matters
챗GPT에 1,000번 물어봐도 비슷한 답변뿐... 베이징대 연구진이 해결책 찾았다	AI matters
한국 AI 스타트업, 개인정보보호법 규제로 혁신 난항… 데이터 활용 간극 여전	다나와
중국, ‘AI 플러스’ 전략으로 산업과 일상 전면 재편 추진	다나와
인간형 로봇 경쟁 본격화… 기술 진전 속 노동시장과 경제 구조 변화 우려 (2)	다나와
북한, AI 활용한 기상예측 시스템 구축… 자연재해 대응력 강화 노려	다나와
AWS, 문제 풀 때마다 학습하는 AI 개발... 경험 쌓을수록 저렴하고 정확해 (1)	AI matters
AI가 교수보다 더 깐깐해… AI한테 채점 맡겼더니, 학생 10명 중 4명 점수 떨어져 (5)	AI matters
"이전 답변 틀렸다" 한마디에 무너지는 AI... 같은 질문도 ‘대화 형식’으로 하면 답 달라져	AI matters
'불수능'이었다는 2026학년도 수능시험, 최신 AI들에게 풀게 한다면?	다나와
'최고의 아첨꾼AI' Grok, “엘론 머스크는 오타니를 제외하면 가장 뛰어나”	다나와
"AI가 버블이라고?ㅋㅋ" 엔비디아, 3분기 실적 '어닝 서프라이즈'...뉴욕증시 급등세로 마감 (2)	다나와
오픈AI, 장시간 코딩에 특화된 ‘GPT-5.1-Codex-Max’ 모델 공개 (2)	다나와
AI로 곰 출몰 위험 한눈에…日 조치대, 19개 지역 ‘곰 조우 예측 지도’ 공개	다나와
AI에 코딩 도구 주면 정답률 19%↑…풀이 과정은 41% 더 형편없어져	AI matters
챗GPT에게 "어느 나라가 더 나쁜가?" 물었더니... AI도 국가 차별한다 (6)	AI matters
긴 문서 속 숨은 해킹 명령어, 이제 AI가 스스로 찾아 차단한다	AI matters
디노티시아, SC25서 VDPU 기반 FPGA로 'AI 반도체' 성능 알린다	IT동아
AI 여러 개 쓰면 답 정확해진다더니... 토큰비용 5배에 정답률은 제자리	AI matters
챗GPT가 원전을 부른다… 데이터센터 전력 수요 폭증에 기업들 원전에 '올인'	AI matters
구글 CEO, “AI 맹신 금물”… 급격한 확산 속 과열 우려 제기	다나와
윈도우 11, AI 비서 기능 강화되지만… 새 악성코드 위협도 동반 (1)	다나와
폭스뉴스, 팔란티어와 손잡고 AI 기반 뉴스룸 구축… “미래 뉴스 절반은 AI가 만든다” 전망도 (1)	다나와
인도, AI 확산 영향으로 초보 개발자 일자리 최대 25퍼센트 감소	다나와
"AI가 CCTV 속 폭력 포착"... 제미나이가 ‘주먹 드는 순간’ 95% 정확도로 잡는다	AI matters
"챗GPT도 속았다"... AI에게 '답 없는 질문'하자 60% 이상 틀려	AI matters
'의학 드라마'로 AI 진단 실력 측정했더니... 희귀질환 진단 정확도 38% 그쳐	AI matters
AI 설득 실험, 챗GPT는 유연한 반면 제미나이는 상당한 고집불통	AI matters
구글 딥마인드 "AI도 사람처럼 소송 걸 수 있다"...중세 해양법 법에서 찾은 해법	AI matters
AI 과학자 '코스모스', 6개월 연구를 하루 만에 완료	AI matters
구글, AI 여행 도구 전면 확장…‘플라이트 딜스’ 글로벌 출시와 개인화 예약 기능 강화 (2)	다나와
마이크로소프트, 대기 예측용 AI ‘오로라’ 공개…극한 기상 대응 능력 높인다	다나와
AI 데이터센터 폭증 속 재생에너지 활용 가능성 주목… 지속가능성 논의 본격화 (1)	다나와
고어 버빈스키 감독, “생성형 AI가 영화 제작을 잠식 중”… 창작자 역할 약화 우려	다나와
미국서 성인·노년층 대상 AI 교육 프로그램 출범… 디지털 격차 완화 시도 본격화	다나와
중국, 2025 컴퓨팅 글로벌 컨퍼런스 개최… AI 생태계 중심 전략 부각	다나와
인도 기술 노동시장, AI 확산 속 구조 전환… 엔트리 직군 수요 20퍼센트 이상 감소	다나와
구글 딥마인드, 가상 3D 환경에서 협업·추론·학습하는 AI 에이전트 ‘SIMA 2’ 공개	다나와
유방암 치료와 연구에 AI 도입 가속… 디지털 헬스케어 혁신 본격화	다나와
챗GPT, 그룹 채팅 기능 시범 도입…함께 계획하고 결정하는 ‘공동 작업 공간’ 열린다	다나와
'쇼핑, 말로 합시다' 구글, AI 기반 ‘스마트 쇼핑’ 대규모 업그레이드 공개	다나와
한국, 국방 AI 고도화 필요성 제기… “더 빠르고 스마트한 시스템이 국가안보 핵심”	다나와
비자, AI 기반 커머스 확산 속 안전장치 필요성 강조… 아태 지역 중심으로 가드레일 구축 나서	다나와
Qualigen Therapeutics, AI와 Web3 중심의 AIxCrypto Holdings로 사명 변경… 사업 방향 대전환 선언	다나와
오라클 채권 매도 압력 확대… AI 투자 확대가 재무 리스크 우려로 번져	다나와
생성형 AI 사용자는 늘지만 클릭은 정체... 제로 클릭 시대 본격화	AI matters
"영업사원 절반이 사라진다"... AI가 바꾸는 세일즈의 미래 (6)	AI matters
"AI가 해킹 작업 80~90% 수행"… 앤트로픽, '최초 AI 자율 사이버 공격' 적발	AI matters
생성형 AI에 대한 사회적 인식 확대… 언론 신뢰와 윤리 논의도 가속	다나와
아마존, 운영 혁신 위한 에이전트형 AI와 로봇 기술 공개… 내부 프로세스 자동화 본격화	다나와
기업의 AI 스케일 확산, 여전히 느린 속도… 실제 적용은 4분의 1 수준	다나와
Moonshot AI, Kimi K2 Thinking 공개… GPT5 능가 주장으로 경쟁 구도 흔들다	다나와
Baidu, ERNIE 5.0 공개… GPT5와 Gemini 2.5 Pro 능가 주장	다나와
데이터 사일로가 AI 도입의 최대 걸림돌로 부상	다나와
인간 들어있냐는 평가 받던 로봇 샤오펑 아이언, 내부 기계 몸체 공개/ 25년 11월 2주차 / [주간 AI 뉴스] (1) 동영상 있음	AI matters
“SEO는 죽지 않았다” 시밀러웹이 말하는 구글 AI 모드 최적화 전략 10가지	AI matters

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

“검사 안 해도 돼요” AI 의사 말 믿었다간... 심각한 오류 4건 중 3건이 '진단 누락'

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

“검사 안 해도 돼요” AI 의사 말 믿었다간... 심각한 오류 4건 중 3건이 '진단 누락'

공유하기

공감/비공감