유방 촬영술 보고서 임상 소견 추출: AI와 전문가 비교 연구 결과
Extraction of clinical findings from mammography and breast ultrasound reports: a comparison between specialists and Artificial Intelligence
arXivLLM이 유방 촬영술 및 초음파 보고서에서 임상 소견을 추출하는 성능을 전문가의 수동 작업과 비교 분석했습니다.
- 최적화된 LLM은 전문가보다 높은 정확도를 보였으며, 특히 사람이 누락하거나 잘못 기록한 정보를 찾아내는 능력을 입증했습니다.
- 이 기술은 의료 보고서 처리 속도를 높이고 진단 과정의 정확성을 보완하는 강력한 지원 도구로 활용될 수 있습니다.
- 다만, LLM은 전문 의료진을 대체하기보다 검증을 돕는 보조 도구로 사용해야 하며, 프롬프트 엔지니어링에 의존합니다.
브라질에서 유방암은 주요 사망 원인이며, 검진 보고서 처리 속도는 조기 진단에 중요한 요소입니다. 본 연구는 (LLM)의 성능을 건강 연구팀이 수동으로 추출한 결과와 비교했습니다. 특히 브라질 포르투갈어로 작성된 유방 촬영술 및 초음파 보고서에서 임상 소견을 식별하기 위해 Gemini 2.5 Flash 모델에 엔지니어링( 전략)을 적용하여 개체명 인식(NER)을 수행했습니다.
실험 결과, Gemini 2.5 Flash 모델은 Macro F1 점수 0.91과 Micro F1 점수 0.98을 달성하며 우수한 성능을 보였습니다. 이는 수동 추출 방식 대비 전반적인 Macro F1 (0.72)보다 높은 수치입니다. 또한, 이 모델은 전문가가 누락했거나 잘못 기록한 정보를 네 건의 보고서에서 정확히 식별하는 능력을 입증했습니다.
주관적 검증 단계에서는 건강 연구원들이 다양한 형식의 29개 검사를 Likert 척도를 사용해 평가했으며, 이 과정에서 93.1%의 일치 지수(agreement index)를 기록했습니다. 연구진은 LLM이 전문 의료진의 수동 추출과 비교할 만하거나 더 우수한 성능을 달성할 수 있음을 확인하며, 이를 전문가를 대체하기보다 보완적인 검증 도구로 활용해야 한다고 결론지었습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- few-shot
- 몇 개의 예시를 함께 보여 주고 과제를 시키는 방식.