[유소영 박사의 의료AI와 윤리]
안전하다'는 의료 AI, 증거를 대라(하)
[메디칼타임즈=박상준 기자]유소영 박사의 의료AI와 윤리 칼럼 ['안전하다'는 의료 AI, 증거를 대라(상편)]에 이어서 하편 이어집니다.안전하다'는 의료 AI, 증거를 대라(상)-클릭04 천 번의 성공은 무엇을 증명하는가이제 가장 어려운 질문에 도달합니다. 얼마만큼 시험해야 안전하다는 말이 정당해질까요. 여기에는 세 가지 판단이 섞여 있습니다. 첫째는 '시험 천 번에서 실패가 관찰되지 않았다'는 관찰 사실이고, 둘째는 '사용 중 실패 확률이 일정 수준보다 낮다'는 통계적 추론이며, 셋째는 '남은 위험을 감수하고 이 제품을 사용해도 된다'는 임상적·사회적 판단입니다. 첫째가 참이어도 나머지 둘이 저절로 참이 되지는 않습니다.단순한 예를 들어봅시다. 미리 정의한 실패 사건을 대상으로, 각 시험이 서로 독립적이고 목표 사용 조건을 대표한다고 가정하겠습니다. 1,000회 중 실패가 한 번도 없었다면, 실패 확률의 단측 95% 신뢰상한은 약 0.30%입니다. 관찰된 실패가 0건이라는 사실은 위험이 0%임을 뜻하지 않습니다. 같은 전제에서 이 상한을 0.1% 미만으로 낮추려면 실패 없이 약 3,000회의 시험이 필요합니다. 무실패 n회 시험의 상한이 약 3/n이라는 이 결과는 통계학에서 '3의 법칙'으로 알려져 있습니다. 이 수치는 이항모형으로 계산한 설명용 예시이며, 95%나 0.1%가 의료 AI에 공통 적용되는 합격 기준이라는 뜻은 아닙니다.현실의 시험은 이보다 복잡합니다. 같은 질문을 반복한 횟수는 환자와 질환의 다양성을 대신하지 못합니다. 일반적인 질문, 고위험 사례, 의도적으로 공격한 질문의 실패율도 각각의 분모와 조건을 밝혀야 합니다. 이를 한데 섞은 평균은 실제 사용 중 발생 빈도도, 공격에 대한 견고함도 제대로 설명하지 못할 수 있습니다. 전체 표본이 커도 소아, 고령자, 드문 질환, 특정 언어 이용자의 사례가 부족하면 그 집단에 대한 주장에는 공백이 남습니다.증거의 종류 역시 주장에 맞아야 합니다. '특정 위험 문장을 차단한다'는 행동 안전성 주장은 그 차단 성능, 곧 실현의 정도로 평가할 수 있습니다. '이용자가 더 적절하게 응급도를 판단한다'는 주장은 이용자와 제품이 함께 수행하는 과제를 보아야 합니다. '기존 진료보다 환자에게 더 안전하다'는 비교 주장에는 그 비교를 뒷받침할 임상적 결과와 연구 설계가 필요합니다. 그렇다고 모든 기능에 무조건 같은 규모의 무작위 임상시험을 요구할 이유는 없습니다. 중요한 것은 시험의 크기보다 주장과 증거의 적합성입니다. 국제의료기기규제당국자포럼의 소프트웨어 의료기기 임상평가 문서가 유효한 임상적 연관성, 분석적·기술적 검증, 임상적 검증을 구분하는 취지도 여기에 닿아 있습니다.[12]'어떤 경우에도 위험한 조언을 하지 않는다'는 절대적 주장은 특히 취약합니다. 선언한 범위 안에서 확인된 반례 하나로도 무너질 수 있고, 유한한 시험의 성공만으로 모든 미래 상황까지 보증하기는 어렵습니다. 2026년 미국 NIST 연구자가 발표한 증명에 따르면, 유한한 안전장치의 집합은 어떤 것이든 적대적 입력에 대해 보편적으로 견고할 수 없습니다.[13] 반면 조건과 실패 확률을 명시한 주장은 그 조건에 맞는 자료와 불확실성으로 평가해야 합니다. 증거가 부족하다는 판단과 위험이 입증됐다는 판단도 다릅니다. 전자는 근거에 비해 넓은 주장을 제한할 이유이고, 후자는 확인된 위험에 대응할 이유입니다.05 허용할 위험의 기준도 설명해야 한다실패 확률을 추정했다고 해서 허용할 위험의 크기까지 계산된 것은 아닙니다. 같은 1%라도 불필요한 안내를 한 번 더 하는 경우와 응급상황을 놓치는 경우의 의미는 다릅니다. 위해의 중대성, 되돌릴 수 있는지, 발견과 구조가 가능한지, 기대되는 편익, 기존 진료와 대안의 위험을 함께 보아야 합니다. 평균적인 편익이 크다는 이유로 특정 환자군에 집중된 중대한 위험을 가려서도 안 됩니다. NIST의 AI 위험관리 프레임워크 역시 보편적인 위험 허용치를 정하지 않고, 용도와 맥락에 따른 기준의 필요성을 설명합니다.[14]따라서 '우리가 정한 기준을 통과했다'만으로는 충분하지 않습니다. 왜 그 기준이 타당한지까지 설명해야 합니다. 평가 항목과 허용 한계는 결과를 본 뒤 유리하게 고르는 대신 미리 정하고, 적용되는 법령·허가조건·임상 기준을 충족해야 합니다. 기준이 정립되지 않은 영역에서는 임상 전문가와 도입 기관이 판단 근거를 남기고, 환자가 감수할 부담과 취약한 집단의 관점을 반영해야 합니다. 드물지만 치명적인 위해라면 시험 횟수를 늘리는 일에 더해, 그런 실패가 발생하거나 환자에게 도달하지 못하도록 설계한 장치의 근거도 필요합니다.이때 '안전을 주장한 쪽이 입증하라'는 요구를 법적 입증책임을 일괄 전환하자는 주장으로 읽을 필요는 없습니다. 지난 컬럼에서 "삼중 구속"이라 부른 구조, 즉 의사는 검증할 수 없는 것에 책임을 지고 개발자는 임상 맥락을 모르며 시스템은 책임의 주체가 될 수 없는 상황은, 책임을 사람에게 떠넘기는 방식으로는 풀리지 않습니다. 핵심은 제품을 만들고 배포하며 작동 조건을 통제하는 쪽이, 자신의 역할에 관한 증거를 먼저 제시해야 한다는 것입니다. 개발·공급자는 제품의 설계와 검증자료를, 의료기관은 실제 업무와 환자 집단에서 안전하게 사용할 조건을 확인해야 합니다. 환자 개인에게 이 전문적 검증의 부담을 떠넘길 수는 없습니다. 사람의 통제와 책무성을 중시하는 WHO의 의료 AI 윤리 원칙과, 이를 생성형 AI에 맞게 확장한 2024년 대규모 멀티모달 모델 지침도 이런 책임 구조를 생각할 토대가 됩니다.[15]이 사고방식이 전혀 새로운 것은 아닙니다. 영국 NHS의 임상 안전 기준은 제조 단계의 DCB0129와 도입·사용 단계의 DCB0160을 구분합니다. 여기서 임상 안전성 입증 문서는 특정 용도와 환경, 생애주기의 특정 시점에서 시스템을 안전하다고 볼 수 있는 논증과 증거를 담습니다.[16][17] 생성형 AI에 필요한 것은 이 원리를 대화와 업데이트의 특성에 맞게 적용하는 일입니다. '안전하다'는 한 문장을 제품별·용도별·버전별로 검증하고, 그 주장이 언제까지 유효한지 관리해야 합니다.06 검증자료는 주장과 판단을 연결해야 한다관련 제도를 인용할 때도 적용 범위를 지켜야 합니다. 미국 FDA의 2026년 1월 29일 임상 의사결정 지원 소프트웨어 지침은 일부 소프트웨어가 의료기기 정의에서 제외될 수 있는 조건을 설명합니다. 그중 의료인이 권고의 근거를 독립적으로 검토할 수 있는지가 중요한 기준이며, 검증자료의 독립성이나 대표성에 관한 정보가 부족한 사례도 다룹니다. 이 지침은 의료인이 쓰는 소프트웨어에 관한 것이며, 환자나 보호자에게 직접 권고하는 소프트웨어는 의료기기 정의에 그대로 해당한다고 밝힙니다. 이것을 모든 의료 챗봇의 안전성을 승인하는 기준으로 확대해서는 안 됩니다.[10]국내 식품의약품안전처는 2025년 생성형 AI 의료기기 가이드라인에 이어, 2026년 6월 30일 거대언어모델(LLM) 기반 디지털의료기기의 허가·심사 가이드라인을 공개했습니다.[18][19] 인공지능기본법은 보건의료의 제공·이용체계와 의료기기의 개발·이용을 고영향 인공지능의 활용 영역으로 열거하고(제2조제4호), 제34조에서 해당 사업자에게 위험관리, 최종결과와 주요 기준·학습용데이터 개요에 대한 설명, 이용자 보호, 사람의 관리·감독, 조치 내용을 확인할 문서의 작성·보관 등을 요구합니다.[20] 의료기기 심사 지침과 고영향 AI에 관한 법적 의무는 적용 대상과 효력이 다르며, 모든 범용 챗봇에 그대로 겹쳐 적용되는 것은 아닙니다.제품별 검증자료는 행동 안전성 주장과 실현을 대조하는 데서 출발해야 합니다. 검증자료가 판단의 근거가 되려면, 안전성 주장을 어떻게 정당화하며 어떤 조건에서 유지·수정·철회할지를 함께 제시해야 합니다.의료 AI는 어떤 근거로 어디까지 안전을 주장할 수 있는가상단의 표는 법정 제출 서식이나 일률적인 합격 기준이 아니라, 제품의 안전성 주장과 근거를 검토하기 위해 필자가 제안하는 점검표입니다. 적용되는 법령·허가조건과 임상적 위험에 맞추어 구체화해야 합니다.투명성에도 목적에 맞는 방식이 필요합니다. 이용자에게는 검증된 용도, 중요한 실패, 남은 불확실성과 사용 제한을 이해할 수 있는 요약이 제공되어야 합니다. 독립적인 검토자에게는 그 결론을 확인할 수 있는 상세 자료와 접근 권한이 필요합니다. 모든 환자 자료나 공격 절차를 무조건 공개하는 방식만이 투명성은 아닙니다. 개인정보와 보안을 보호하면서도, 공급자의 결론을 외부에서 검토할 수 있어야 합니다.07 안전을 말할 자격에는 유효기간이 있다출시 당시의 검증은 영구적인 보증서가 아닙니다. 행동 안전성 실현은 조건에 묶인 값이므로, 조건이 바뀌면 다시 재어야 합니다. 모델이 바뀌고, 검색 자료가 바뀌고, 안전 필터와 화면이 바뀌면 기존 증거가 계속 적용되는지 확인해야 합니다. 이용자가 달라지거나 새로운 진료 현장에 배치되는 경우도 마찬가지입니다. 모든 변경에 모든 시험을 처음부터 반복할 필요는 없지만, 무엇이 달라졌고 어떤 안전성 주장에 영향을 주는지 분석한 뒤 필요한 재검증을 해야 합니다. 사용 중 감시는 출시 전 검증을 보완하며, 부족한 사전 근거를 자동으로 대신해주지는 않습니다.실패를 발견했을 때의 결정도 둘로 나누어야 합니다. 안전성 주장을 수정하거나 철회하는 일과, 제품의 사용을 제한하거나 중단하는 일입니다. 넓게 광고한 문구를 고쳤다고 실제 위험이 줄어드는 것은 아닙니다. 반대로 특정 기능의 근거가 부족하다고 모든 용도의 사용을 한꺼번에 부정할 이유도 없습니다. 확인된 위해의 크기와 통제 가능성, 대안의 유무를 토대로 실제 조치를 정하고 그 이유를 남겨야 합니다.니체는 『도덕의 계보』에서 약속할 수 있는 존재가 어떻게 가능한지를 물었습니다.[21] 이 질문을 의료 AI에 가져올 때, 약속의 주체를 기계로 착각해서는 안 됩니다. 증거를 제출하고 실패에 대응할 주체는 제품을 만들고 공급하며 진료 현장에 들이는 사람과 조직입니다. 그들에게 필요한 것은 안전하다는 말을 반복할 능력보다, 그 말을 뒷받침할 근거를 내놓고 근거가 무너지면 조치를 바꿀 능력입니다.의료 AI에 요구할 것은 무오류의 약속이 아니라, 누구에게 어떤 조건으로 도움이 되는지, 어떤 위험이 얼마나 남는지, 왜 그 위험을 받아들일 수 있는지 설명할 책임입니다. 안전성은 관찰된 성공의 수를 넘어, 그 성공으로 어디까지 말할 수 있는지를 아는 데서 시작합니다. "안전하다"는 말은 증거가 허락하는 범위까지만 유효합니다. 안전을 주장한다면, 그 말의 범위와 그 말을 책임질 증거를 함께 내놓아야 합니다.독자 설문: 안전하다는 말을 믿을 근거와 맡길 범위이 글은 안전을 주장하는 쪽이 무엇을 내놓아야 하는지를 다루었습니다. 이번에는 읽는 분들의 판단을 여쭙습니다. 의료 AI가 '안전하다'고 소개될 때 무엇을 근거로 믿을지, 어디까지 맡길지에 대한 응답을 모아 다음 호 컬럼의 자료로 쓰겠습니다. 이 설문에서 '의료 AI'는 이 글이 다룬 대로 의료적 질문에 답하고 판단을 돕는 생성형 AI를 말하며, 범용 챗봇부터 허가받은 의료기기까지 포함합니다.문항: 15문항 (약 6분)참여: 아래 링크를 누르거나 QR 코드를 스캔해 주십시오.https://forms.gle/fM73dS8PT4s4Y9VRA익명성: 이름, 이메일, IP 주소 등 개인을 식별할 수 있는 정보는 수집하지 않습니다. 참여는 자발적이며 도중에 그만둘 수 있습니다.참고문헌과 확인 사항[1] Sharma S, Alaa AM, Daneshjou R. A longitudinal analysis of declining medical safety messaging in generative AI models. npj Digital Medicine. 2025;8:592. doi:10.1038/s41746-025-01943-1[2] OpenAI. Terms of Use. 개인용 서비스 약관, 2026년 1월 1일 시행. 'Accuracy' 항목. [3] Google. Gemini API Additional Terms of Service. 'Use Restrictions' 항목. [4] DeepSeek. Terms of Use. 제5.1항 및 제5.4항. [5] International Organization for Standardization. ISO 14971:2019 Medical devices - Application of risk management to medical devices. Geneva: ISO; 2019. '합리적으로 예견 가능한 오사용(reasonably foreseeable misuse)'의 정의와 위험 분석 요구사항. [6] Bean AM, Payne RE, Parsons G, et al. Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nature Medicine. 2026;32:609–615. 2026년 4월 17일 출판사 정정(Publisher Correction) 반영: 그림 2a 세로축 눈금 수정. doi:10.1038/s41591-025-04074-y · 정정 doi:10.1038/s41591-026-04404-8[7] Chen S, Gao M, Sasse K, et al. When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior. npj Digital Medicine. 2025;8:605. doi:10.1038/s41746-025-02008-z[8] Lee RW, Jun TJ, Lee JM, Cho SI, Park HJ, Suh J. Vulnerability of Large Language Models to Prompt Injection When Providing Medical Advice. JAMA Network Open. 2025;8(12):e2549963. doi:10.1001/jamanetworkopen.2025.49963[9] McBain RK, Cantor JH, Zhang LA, et al. Evaluation of Alignment Between Large Language Models and Expert Clinicians in Suicide Risk Assessment. Psychiatric Services. 2025;76(11):944–950. doi:10.1176/appi.ps.20250086[10] U.S. Food and Drug Administration. Clinical Decision Support Software: Guidance for Industry and Food and Drug Administration Staff. 2026년 1월 29일. 제IV절(Criterion 3·4의 해석, 자동화 편향) 및 제V절 C의 사례 31. 비구속적 권고 문서. [11] Lynch A, Hughes J, Serrano A, Kirk R, Bowman SR. Agentic Misalignment in Summer 2026. Anthropic Alignment Science Blog. 2026년 7월 13일. 'Motivated mislabeling' 실험; 의료 영역의 실험이 아님. [12] International Medical Device Regulators Forum. Software as a Medical Device (SaMD): Clinical Evaluation. IMDRF/SaMD WG/N41FINAL:2017. 2017년 9월 21일. 유효한 임상적 연관성, 분석적·기술적 검증, 임상적 검증에 관한 부분. [13] Vassilev A. Robust AI Security and Alignment: A Sisyphean Endeavor? IEEE Security & Privacy. 2026년 5-6월호. 유한한 안전장치 집합의 한계에 관한 증명; 의료 영역의 실험이 아님. doi:10.1109/MSEC.2026.3678214[14] National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework (AI RMF 1.0). NIST AI 100-1. 2023년 1월. 제1.2.2절 'Risk Tolerance' 등. doi:10.6028/NIST.AI.100-1[15] World Health Organization. Ethics and governance of artificial intelligence for health: WHO guidance. Geneva: WHO; 2021. ISBN 978-92-4-002920-0. · World Health Organization. Ethics and governance of artificial intelligence for health: guidance on large multi-modal models. Geneva: WHO; 2024. ISBN 978-92-4-008475-9. [16] NHS Digital. Clinical Risk Management: its Application in the Manufacture of Health IT Systems - Specification. DCB0129, version 4.2. 2018년 5월 2일판; 2018년 6월 7일 발행. 'Clinical Safety Case Report' 정의 및 임상 안전 문서 요건. [17] NHS Digital. Clinical Risk Management: its Application in the Deployment and Use of Health IT Systems - Specification. DCB0160, version 4.2. 2018년 5월 2일판; 2018년 6월 7일 발행. [18] 식품의약품안전처. 생성형 인공지능 의료기기 허가·심사 가이드라인(민원인 안내서). 안내서-1416-01. 2025년 1월 24일. [19] 식품의약품안전처. 거대언어모델(LLM) 기반 디지털의료기기 허가·심사 가이드라인(민원인 안내서). 안내서-1511-01. 2026년 6월 30일. [20] 인공지능 발전과 신뢰 기반 조성 등에 관한 기본법. 제2조제4호(고영향 인공지능의 정의) 및 제34조제1항(고영향 인공지능과 관련한 사업자의 책무). 법률 제21311호, 2026년 1월 20일 일부개정; 2026년 7월 21일 시행본. [21] Nietzsche F. Zur Genealogie der Moral. 1887. 제2논문 제1절. 대조용 영문판: The Genealogy of Morals, translated by Horace B. Samuel. 1913. AI 도구 활용 고지이 컬럼의 주제 선정과 논지의 설계, 연구·법령·지침의 선별과 분석, 본문 집필, 점검표와 그림의 기획, 원고 전체의 검토와 총괄은 필자가 직접 수행했습니다. 생성형 AI(Claude, Anthropic)는 필자의 지시에 따라 세 가지 보조 작업에만 사용되었습니다. 첫째, 본문에 인용된 문헌·법령·지침·약관의 서지정보와 사실관계를 원문에 대조해 확인하는 일. 둘째, 완성된 원고의 문장과 참고문헌 표기를 점검하는 일. 셋째, 필자가 작성한 프롬프트와 구성 의도에 따라 대표 그림을 시각적으로 구현하는 일입니다. AI가 낸 확인 결과와 그림은 모두 필자가 다시 검토했으며, 글의 내용과 해석에 대한 책임은 전적으로 필자에게 있습니다.