리서치 연구
LLM과 한의사 비교 평가: 임상 사례 기반 분석 결과
Large Language Models Versus Physicians in Traditional Chinese Medicine: A Real-World Clinical Case Evaluation
arXiv연구진이 62개 병원의 임상 사례를 활용하여, 최신 LLM과 숙련된 한의사의 진단 및 치료 능력을 실제 환자 케이스로 비교 평가했습니다.
세 줄 요약
- LLM은 전반적인 의학적 조언에서 높은 점수를 받았으나, 약재 선택이나 용량 등 구체적인 처방 분석에서는 전문가와 차이를 보였습니다.
- 이는 LLM이 한의학 분야에서 강력한 의사 결정 지원 도구로서 잠재력이 크지만, 전문 의료진의 면밀한 검토가 필수적임을 시사합니다.
- 다만, LLM은 처방 과정에서 오류나 환각 현상(Hallucination)을 일으킬 위험이 있어 안전성 확보와 임상 검증이 중요합니다.
연구진은 62개 병원에서 수집한 349개의 익명화된 외래 환자 사례를 활용하여 의 임상 적용 가능성을 평가했습니다. 이 연구에서는 16개의 최신 LLM과 60명의 현직 한의사로 구성된 비교 그룹을 설정하고, 라이브러리에서 선별된 60개 대표 케이스를 이용해 모델 출력물과 의사 보고서를 분석했습니다. 다섯 명의 수석 TCM 전문가가 이 결과를 진단 및 치료 등 총 아홉 가지 차원에서 평가했습니다.
평가 결과, 최신 범용 LLM은 특히 의료 조언, 치료 원칙, 그리고 일부 진단 과제에 대해 비교 그룹인 한의사보다 높은 전문가 점수를 기록하며 잠재력을 입증했습니다. 이는 LLM이 한의학 분야에서 의사 결정 지원 도구로서 강력한 역할을 할 수 있음을 시사합니다.
다만, 처방 수준의 분석에서는 약재 선택, 용량, 치료 전략 등 구체적인 부분에서 전문가와 차이를 보였습니다. 또한 질적 안전성 검토 과정에서는 LLM이 현상(hallucinations)이나 바람직하지 않은 템플릿 기반 출력을 생성할 위험성이 확인되어, 전문 의료진의 감독과 임상적 검증이 필수적임을 강조했습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 환각
- AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.