← 스터디

스터디 · 2026-10-10 · 기초

의료 AI: 영상 판독에서 임상 LLM까지

의료 AI는 흉부 X선 판독 모델에서 시작해 의사 국가시험 문제를 푸는 임상 LLM으로 넓어졌다. 시험 점수가 실제 진료 성능을 보장하지 않는다는 점이 드러나면서 GMLP 원칙, WHO 권고, 실제 진료 조건에 가까운 평가가 함께 중요해졌다.

목차
핵심 정리
  • 영상 판독 모델은 사진 한 장으로 특정 질환일 확률을 내는 좁은 도구이고, 임상 LLM은 글로 묻고 답하는 넓은 도구여서 실패하는 방식도 다르다.
  • Med-PaLM 계열과 GPT-4는 의사 국가시험형 문제에서 높은 점수를 냈지만, 저자들 스스로 실제 진료 환경에서 추가 검증이 필요하다고 밝혔다.
  • 최근 연구는 잡담·배경 음성 오염, 하네스에 따라 달라지는 점수, '결정할지 물어볼지 넘길지' 판단처럼 시험지 밖에서 생기는 실패를 재기 시작했다.
  • 미국 FDA·캐나다 보건부·영국 MHRA의 GMLP 10원칙은 대표성 있는 데이터, 학습·테스트 데이터 분리, 사람-AI 팀 성능, 배포 후 모니터링을 요구한다.
  • WHO는 자동화 편향, 데이터 편향, 사이버 보안을 위험으로 꼽고 독립 제3자 감사를 권고했다. 최종 판단의 책임은 사람에게 남아 있다.

왜 의료에 AI가 필요했나

의료는 판단 하나가 환자의 몸에 바로 영향을 주는 분야다. 흉부 X선으로 폐렴을 찾는 일을 예로 들어 보자. CheXNet 논문논문은 미국 질병통제예방센터(CDC) 통계를 인용해, 미국에서만 해마다 100만 명이 넘는 성인이 폐렴으로 입원하고 약 5만 명이 숨진다고 적었다. 흉부 X선은 폐렴 진단에 쓸 수 있는 가장 좋은 방법이지만, 결국 영상의학과 전문의가 있어야 판독할 수 있다는 것이 이 논문이 출발한 문제의식이다.

판독 자체도 쉽지 않다. 같은 논문에 따르면 폐렴은 X선에서 흐릿하게 보이고, 다른 질환과 겹치거나 해롭지 않은 이상 소견과 비슷해 보이기도 한다. 그래서 전문의끼리도 판단이 크게 엇갈린다. 논문은 영상 전문의를 만나기 어려운 지역의 환자에게 자동 판독이 도움이 될 수 있다는 점도 동기로 들었다.

언어 쪽 문제는 성격이 다르다. 임상 지식 LLM 연구논문는 그때까지의 의료 AI가 분류, 회귀, 분할처럼 한 가지 일만 하는 시스템이어서 말로 묻고 답하는 실제 진료 흐름과 맞지 않았다고 지적했다. 지식 검색, 임상 의사결정 지원, 핵심 소견 요약, 환자의 1차 분류(트리아지)에 LLM(대규모 언어 모델)을 쓸 수 있다는 기대가 여기서 나왔다. 같은 논문은 그럴듯한 의료 오정보를 지어내는 환각(Hallucination)과 건강 격차를 키울 수 있는 편향도 위험으로 함께 꼽았다.

핵심 아이디어: 판독기와 상담자, 그리고 시험과 진료

의료 AI는 크게 두 갈래로 나눠 보면 이해하기 쉽다. 첫째는 영상 판독 모델이다. 사진 한 장을 받아 '이 사진에 폐렴이 있을 확률'처럼 정해진 질문 하나에 답한다. 범위는 좁지만 그 안에서는 깊이 들어간다. 둘째는 임상 LLM이다. 글로 된 질문을 받아 글로 답하는 상담자에 가깝다. 다룰 수 있는 범위는 넓지만, 어디서 틀릴지 미리 알기가 더 어렵다.

두 갈래 모두 같은 질문을 피할 수 없다. '시험을 잘 보면 진료도 잘하는가?' 운전면허 필기시험 만점이 실제 도로 운전 실력을 보장하지 않는 것과 비슷하다. 시험 문제는 정답이 정해져 있고 정보가 깔끔하게 주어진다. 실제 진료에서는 정보가 빠져 있거나, 상관없는 이야기가 섞여 있거나, 의사가 AI 답을 그대로 믿어 버리는 상황이 생긴다.

그래서 이 분야의 흐름은 두 가지 축으로 보면 된다. 하나는 모델이 문제를 얼마나 잘 푸는가이고, 다른 하나는 그 점수를 실제 진료 성능으로 믿어도 되는가를 따지는 평가 방법과 규제다. 이 글은 두 축을 차례로 다룬다.

어떻게 작동하나

CheXNet논문은 121층짜리 합성곱 신경망(CNN, 이미지의 국소 패턴을 층층이 읽는 신경망)이다. 정면 흉부 X선을 224×224 크기로 줄여 넣으면 폐렴일 확률과 함께, 판단 근거가 된 영역을 색으로 표시한 히트맵을 내놓는다. 일반 사진 데이터셋인 ImageNet으로 미리 학습한 가중치에서 출발해, 30,805명의 환자에게서 얻은 112,120장짜리 ChestX-ray14 데이터로 학습했다. 이 데이터셋의 질환 라벨은 영상 판독 보고서에서 자동으로 뽑아낸 것이다.

이 과정에서 눈여겨볼 장치가 둘 있다. 하나는 폐렴 사례가 전체에서 적다는 클래스 불균형(Class Imbalance)을 다루려고, 양성과 음성의 비율에 따라 오차에 가중치를 다르게 준 것이다. 다른 하나는 학습·검증·테스트 세트를 나눌 때 같은 환자가 두 세트에 함께 들어가지 않게 한 것이다. 같은 환자의 사진이 학습과 시험에 모두 들어가면 점수가 실제보다 좋게 나오기 때문이다.

임상 LLM은 방식이 다르다. 임상 지식 연구논문는 5,400억 파라미터 모델인 PaLM에 지시 따르기 학습을 더한 Flan-PaLM을 썼다. 여기에 예시 몇 개를 보여 주는 few-shot, 단계별로 생각하게 하는 CoT(Chain-of-Thought), 여러 번 답하게 한 뒤 가장 많이 나온 답을 고르는 self-consistency를 섞어 객관식 문제를 풀게 했다. 이어서 적은 예시로 의료 분야에 맞추는 지시 프롬프트 튜닝(instruction prompt tuning)을 적용해 Med-PaLM을 만들었다. 후속인 Med-PaLM 2논문는 바탕 모델을 PaLM 2로 바꾸고, 의료 분야 파인튜닝과 여러 답을 모아 다듬는 앙상블 정제(ensemble refinement) 프롬프트를 더했다.

두 경우 모두 모델의 출력은 의료진이 판단할 때 참고하는 정보다. 아래 규제 절에서 다룰 GMLP 원칙 문서글도 모델 혼자의 성능이 아니라 사람-AI 팀의 성능을 보라고 강조한다.

판독 모델과 임상 LLM의 처리 흐름흉부 X선 → 121층 CNN; 121층 CNN → 폐렴 확률; 폐렴 확률 → 의료진 판단(참고); 의료 질문 → Flan-PaLM; Flan-PaLM → 지시 프롬프트 튜닝; 지시 프롬프트 튜닝 → Med-PaLM 답변; Med-PaLM 답변 → 임상의 패널 평가영상 판독 모델임상 LLM흉부 X선정면 사진224×224로 축소121층 CNNDenseNetImageNet 사전학습폐렴 확률+ 근거 히트맵의료진 판단사람-AI 팀의료 질문시험·일반인 질문Flan-PaLMfew-shot·CoTself-consistency지시 프롬프트 튜닝적은 예시로 의료 적응Med-PaLM 답변임상의 패널 평가사실성·해 가능성·편향참고
판독 모델과 임상 LLM의 처리 흐름 위 줄은 CheXNet이 X선을 받아 확률을 내는 흐름이고, 아래 줄은 Flan-PaLM이 Med-PaLM이 되어 임상의 평가를 받기까지의 흐름이다.

발전 흐름: 판독 점수에서 임상의 패널 평가까지

CheXNet논문은 현직 영상의학과 전문의 4명이 판독한 420장의 테스트 세트에서 F1 점수 0.435를 기록했다. 전문의 평균은 0.387이었다. F1 점수는 놓친 환자와 잘못 짚은 환자를 함께 반영하는 지표다. 같은 모델을 14개 흉부 질환으로 넓혔을 때도 당시 발표된 최고 결과를 모두 넘었다. 다만 이 비교는 한 데이터셋의 사진 420장에서 F1이라는 한 가지 지표로 잰 결과다.

임상 지식 연구논문는 평가 방식을 넓혔다. 의사 국가시험, 의학 연구, 일반인 질문을 아우르는 벤치마크(Benchmark) MultiMedQA를 묶고, 사실성, 정밀성, 해 가능성, 편향 같은 여러 축으로 사람이 답을 평가하는 틀을 제안했다. Flan-PaLM은 미국 의사면허시험(USMLE)형 문제인 MedQA에서 67.6%를 기록해 이전 최고 기록을 17% 넘게 앞섰다. 하지만 임상의 패널이 긴 답변을 평가해 보니 과학적 합의와 일치한 답은 61.9%에 그쳤다. Med-PaLM은 이 비율이 92.6%로 임상의 답변(92.9%)과 비슷했고, 해로운 결과로 이어질 수 있는 답의 비율도 Flan-PaLM 29.7%에서 Med-PaLM 5.8%로 줄어 임상의(6.5%)와 비슷했다. 그런데도 저자들은 Med-PaLM이 여전히 임상의보다 부족하다고 결론지었다.

GPT-4 의료 평가논문는 의료 특화 학습을 하지 않은 범용 모델이 특별한 프롬프트 없이도 USMLE 합격선을 20점 넘게 넘었다고 보고했다. 이 연구는 답이 맞을 가능성을 모델이 얼마나 정확히 가늠하는지(보정, calibration)도 쟀는데, GPT-4가 GPT-3.5보다 보정이 훨씬 잘 되어 있었다. 의료처럼 위험이 큰 분야에서 중요한 성질이다. 학습 중에 시험 내용을 외웠을 가능성도 함께 조사했다.

Med-PaLM 2논문는 MedQA에서 최대 86.5%를 기록했다. 일반인 의료 질문 1066개를 놓고 의사들이 답변 두 개를 나란히 비교했을 때, 임상적 유용성과 관련된 9개 축 가운데 8개 축에서 의사가 쓴 답보다 Med-PaLM 2의 답을 더 선호했다. 모델의 한계를 찌르도록 만든 '적대적' 질문 240개에서도 Med-PaLM보다 모든 평가 축에서 나아졌다. 그래도 저자들은 실제 진료 환경에서 효과를 확인하려면 추가 연구가 필요하다고 분명히 적었다.

임상의 패널이 본 긴 답변 품질

Flan-PaLMMed-PaLM임상의

과학적 합의와 일치
해로울 수 있는 답
일반인 의료 질문에 대한 긴 답변을 임상의 패널이 평가한 비율이다. 지시 프롬프트 튜닝 뒤 Med-PaLM은 두 지표 모두 임상의 답변과 비슷해졌다.

요즘 어디로 가고 있나: 시험지 밖의 실패 찾기

최근 연구는 점수를 더 올리는 것보다 실제 진료 조건에서 생기는 실패를 재는 쪽으로 옮겨 가고 있다. 우발 정보 취약성 연구논문는 진료 대화를 자동으로 기록하는 앰비언트 기록 상황을 살폈다. 환자-의사 대화 576건에서 최신 모델들은 진료와 무관한 잡담을 기록의 35%에 넣었다. 기록의 3.7%에서는 그 잡담을 다른 사람의 말로 잘못 옮기거나 임상 정보처럼 사용했다. 녹음된 모의 진료 57건에서는 다른 환자 진료의 배경 음성이 전사본의 48.2%에 섞였고, 오픈웨이트 모델 4개가 만든 후속 기록의 5.3%에서 그 오염이 확인됐다. 연구진은 임상에 쓰기 전에 이런 우발 정보에 얼마나 버티는지 평가해야 한다고 제안했다.

MedicalHarness논문는 의료 에이전트의 점수가 모델 하나가 아니라 '모델과 하네스(모델과 환경 사이의 반복 고리를 제어하는 시스템)의 조합'이 내는 결과라는 점을 짚었다. 4개 분야 107개 과제에서 오픈웨이트 모델 5개를 하네스 5개로 돌렸더니, 하네스와 하네스-모델 상호작용이 결과 차이의 약 4분의 1을 설명했다. 모든 모델과 과제에서 가장 좋은 하네스는 없었다. 같은 모델이라도 어떤 틀에 넣느냐에 따라 벤치마크 점수가 달라진다는 뜻이다.

'결정·질문·위임' 연구논문는 정보가 모자랄 때 모델이 어떻게 행동하는지를 봤다. 바로 진단할지(DECIDE), 정보를 더 물어볼지(ASK), 의료진에게 넘길지(DEFER)를 나눠서 평가했다. Qwen, Gemini, GPT를 같은 임상 정보 상태 200개에 놓고 보니 200개 중 137개 상태에서 모델끼리 고른 행동이 달랐다. 세 가지 선택지를 둔 방식은 잘못된 자율 판단 일부를 막았지만, 맞았을 판단 일부도 함께 없앴다. 모든 면에서 나아진 정책은 아니었다는 점까지 연구진이 그대로 보고했다.

시험지 밖에서 드러난 숫자

35%잡담이 들어간 진료 기록
48.2%다른 환자 음성이 섞인 전사본
137/200모델끼리 행동이 갈린 상태
약 4분의 1하네스가 설명한 결과 차이
최근 연구들이 실제 진료에 가까운 조건에서 측정한 값이다. 각 수치는 서로 다른 연구와 조건에서 나왔다.
의료 AI 연구 흐름 지도 위쪽은 점수와 평가 틀을 세운 출발점 연구이고, 아래쪽은 실제 진료 조건에서 생기는 실패를 재는 최근 연구다. 화살표는 직접 이어진 후속 연구만 표시했다.

규제와 거버넌스: GMLP 10원칙과 WHO 권고

미국 FDA, 캐나다 보건부(Health Canada), 영국 의약품·의료제품규제청(MHRA)은 머신러닝을 쓰는 의료기기 개발에 적용할 우수 머신러닝 관행(GMLP) 10가지 원칙을 함께 정리했다글. 데이터와 관련된 원칙부터 보면, 임상시험 참여자와 데이터셋이 나이, 성별, 인종, 민족 등에서 대상 환자군을 대표해야 하고(원칙 3), 학습 데이터와 테스트 데이터는 환자, 데이터 수집 방식, 기관 같은 모든 의존 요인을 고려해 서로 독립이어야 한다(원칙 4). 기준 정답(reference standard)은 가장 나은 방법으로 만들고 그 한계를 이해해야 한다(원칙 5).

평가와 운영에 관한 원칙도 있다. 이 문서는 사람이 판단에 참여하는 구조, 즉 휴먼 인 더 루프(Human-in-the-Loop)라면 모델 단독이 아니라 사람-AI 팀의 성능에 초점을 두라고 하고(원칙 7), 실제 진료와 관련된 조건과 중요한 하위 집단에서 시험하라고 한다(원칙 8). 사용자에게는 사용 목적, 하위 집단별 성능, 학습 데이터의 특성, 알려진 한계를 알기 쉽게 알려야 한다(원칙 9). 배포한 모델은 실사용 성능을 모니터링하고, 재학습할 때 과적합(Overfitting), 의도하지 않은 편향, 데이터 드리프트(Data Drift) 같은 성능 저하 위험을 관리해야 한다(원칙 10).

WHO는 2024년 1월 18일 의료용 대규모 멀티모달 모델(LMM)에 관한 윤리·거버넌스 지침을 발표했다글. 이 지침은 정부, 기술 기업, 의료 제공자를 대상으로 40개가 넘는 권고를 담았다. 활용 분야로는 진단과 임상 진료, 환자가 직접 쓰는 증상 탐색, 전자건강기록 요약 같은 행정 업무, 의학·간호 교육, 연구와 신약 개발 다섯 가지를 들었다. 정부에는 의료용 LMM을 평가하고 승인할 규제 기관을 지정하고, 대규모로 배포될 때 독립 제3자가 사후 감사와 영향 평가를 하도록 의무화하라고 권했다. 감사 결과는 공개하고 나이, 인종, 장애 같은 사용자 유형별로 나눠 보고하라는 내용이다. 개발자에게는 의료진과 환자를 개발 초기부터 참여시키고, 모델이 잘 정의된 과제를 필요한 정확도와 신뢰성으로 수행하게 설계하라고 권했다.

GMLP·WHO 기준 점검 목록

데이터

  • 대상 환자군(나이·성별·인종)을 대표하는가
  • 학습·테스트가 환자·기관 단위로 독립인가
  • 기준 정답의 한계를 알고 있는가

평가

  • 모델 단독이 아닌 사람-AI 팀 성능을 쟀는가
  • 실제 진료 조건과 하위 집단에서 시험했는가

배포 후

  • 하위 집단 성능과 알려진 한계를 사용자에게 알렸는가
  • 실사용 성능을 모니터링하는가
  • 재학습 때 드리프트·편향을 관리하는가
  • 대규모 배포 시 독립 제3자 감사를 받는가
GMLP 10원칙과 WHO 권고에서 실무자가 확인할 항목을 단계별로 모았다.

한계와 쟁점: 편향, 책임, 환자 안전

첫째 쟁점은 편향이다. WHO 지침글은 LMM이 인종, 민족, 혈통, 성별, 성 정체성, 나이에 따라 편향되거나 질이 낮은 데이터로 학습될 수 있다고 경고했다. GMLP 원칙글이 대표성 있는 데이터와 하위 집단별 성능 공개를 요구하는 이유도 여기에 있다. 모델의 평균 점수가 높아도 특정 환자 집단에서는 성능이 낮을 수 있다. 기준 정답에도 한계가 있다. CheXNet논문이 학습한 ChestX-ray14의 라벨은 판독 보고서에서 자동으로 뽑은 것이어서, 기준 정답의 한계를 이해하라는 GMLP 원칙 5와 맞닿는다.

둘째는 책임과 자동화 편향이다. WHO글는 의료진과 환자가 LMM을 지나치게 믿어 평소라면 잡았을 오류를 놓치거나, 어려운 결정을 부적절하게 모델에 맡기는 '자동화 편향'을 위험으로 꼽았다. 시험 점수가 아무리 높아도 진단과 치료의 최종 판단과 그 책임은 의료진에게 있다. GMLP 원칙 7이 사람-AI 팀의 성능을 보라고 하는 것도, '결정·질문·위임' 연구논문가 의료진에게 넘기는 선택지를 따로 평가한 것도 같은 맥락이다.

셋째는 점수를 부풀려 읽는 문제다. MedQA 86.5%나 '의사보다 선호된 답'은 정해진 질문과 평가 조건에서 나온 결과다. 이 결과를 실제 진료 성능으로 바꿔 읽어서는 안 된다. Med-PaLM 2논문 저자들도 실제 진료에서 효과를 확인하려면 추가 연구가 필요하다고 적었다. 우발 정보 연구논문와 MedicalHarness논문가 보여 주듯, 진료실의 잡음이나 시스템 구성만 달라져도 결과가 바뀐다.

넷째는 보안과 개인정보다. WHO글는 LMM이 사이버 보안 위험에 취약해 환자 정보와 알고리즘의 신뢰성이 위협받을 수 있다고 지적했다. GMLP 원칙 2도 데이터의 진본성과 무결성을 지키는 보안 관행을 기본으로 요구한다.

더 공부하려면

영상 판독 모델이 어떻게 만들어지고 평가되는지 보려면 CheXNet논문부터 읽으면 좋다. 짧은 논문이지만 데이터 구성, 환자 단위 분리, 클래스 불균형 처리, 전문의와의 비교가 한 번에 들어 있다. 표 1의 신뢰구간을 보면 420장 규모 비교의 불확실성도 함께 느낄 수 있다.

임상 LLM은 임상 지식 연구논문를 먼저 읽는 것을 권한다. 객관식 점수와 임상의 패널 평가가 어떻게 다른 그림을 보여 주는지 가장 잘 드러난다. 이어서 Med-PaLM 2논문와 GPT-4 의료 평가논문를 읽으며 점수 향상과 보정, 암기 가능성 문제를 비교해 보면 된다.

실무와 규제 관점이 필요하면 GMLP 10원칙글을 점검표처럼 읽고, WHO 발표글로 정부·개발자 권고를 확인하면 된다. 최근 평가 흐름은 우발 정보 연구논문, MedicalHarness논문, '결정·질문·위임' 연구논문 순서로 읽으면 '시험지 밖의 실패'를 어떻게 재는지 감을 잡을 수 있다.

관련 용어

벤치마크 환각 휴먼 인 더 루프 CNN 클래스 불균형 데이터 드리프트 하네스 멀티모달

참고 문헌

참고 자료(공식 문서·엔지니어링 글)

핵심 논문

최근 연구

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.