AI 모델 의료 진단 벤치마크: 진단 정확도보다 안전성 격차 확인
의료 등 전문 도메인에서 모델 선택 시 정확도 외에 안전성 제어 능력의 중요성을 시사합니다.
요약
호주의 한 수련의가 의료 상담 게임을 개발하여 13개 AI 모델을 대상으로 임상 진단 성능을 테스트했다. 각 모델은 5개의 가상 사례에 대해 총 3회씩 상담을 진행했으며, 진단 과정과 절차를 기반으로 점수가 산정되었다. 테스트 결과 모든 모델이 195번의 상담에서 진단을 정확히 맞혔으나, 안전성 및 '레드 플래그(Red flags)' 포착 능력에서 성능 차이가 드러났다. 환자 역할은 Qwen3 8B 모델이 맡아 질문을 해야만 정보를 공개하도록 설계되었으며, 모델들은 검사 처방, 진단 등 도구를 통해서만 상호작용했다. 이번 연구는 단순히 정확도를 넘어 의료 AI의 안전성과 프로세스 수행 능력을 평가하는 새로운 지표를 제시했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I made 13 AI models play the doctor in my medical consultation game. All 195 consults got the diagnosis right; what separated them was safety.
원문 보기 ↗