방사선 보고서에서 증거 기반 표현형 추출 모델 CHESTPHENOT 소개
ChestPheNoT: Deployable, Auditable Label-Status-Evidence Extraction from Radiology Reports
arXiv방사선 보고서에서 질병의 유무와 상태뿐 아니라, 해당 주장을 뒷받침하는 구체적인 근거 문구까지 추출하는 새로운 모델이 개발되었습니다.
- CHESTPHENOT은 라벨, 3가지 상태(존재/부재/불확실), 그리고 원문 기반 증거를 동시에 추출하며 높은 정확도를 입증했습니다.
- 외부 클라우드 API에 의존하던 기존 방식의 한계를 극복하고, 병원 내부 인프라에서 데이터 보안을 지키며 분석이 가능합니다.
- 특히 기관 간 데이터 차이가 큰 환경에서도 뛰어난 성능을 보였으며, 추출된 근거 문구의 신뢰도가 매우 높아 임상 활용성이 높습니다.
구조화된 표현형 추출은 방사선 보고서를 활용한 코호트 구축 및 품질 감사에 필수적입니다. 그러나 기존 방식들은 지원하는 근거(evidence)를 제공하지 못하거나, 임상 텍스트가 기관 인프라 외부로 나갈 수 없는 경우 기반 사용이 부적합했습니다. 이러한 한계를 극복하기 위해 CHESTPHENOT이라는 소형 언어 모델을 개발하여 현장 배포 및 감사 가능한 예측 기능을 제공합니다.
CHESTPHENOT은 발견 라벨, 세 가지 상태(존재/부재/불확실), 그리고 원문 기반의 증거 구간을 동시에 추출하도록 설계되었습니다. 이 모델은 하이브리드 CheXbert+72B 실버 감독 학습과 지도 , 경량 GRPO 개선 과정을 거쳐 훈련되었으며, 이를 통해 로컬 환경에서도 높은 성능을 유지할 수 있습니다.
성능 평가 결과, CHESTPHENOT(3B 모델)은 기관 간 데이터 차이가 큰 환경에서도 경쟁력을 보였으며, 특히 교차 기관 탐지에서 CheXbert 대비 +2.0 F1을 달성했습니다. 증거 기반 추출의 경우 최종 증거 구간의 99% 이상이 원본 보고서에서 위치할 수 있었고, 47.5 auditable-F1를 기록하여 Qwen2.5-7B one-shot 프롬프팅보다 7.6 포인트 높은 성능을 보였습니다.
용어 풀이
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.