리서치 연구
의료 QA에서 근거 정보 선택을 통한 모델 견고성 확보 연구
Which Medical Questions Deserve Rationales? Perturbation-Sensitive Selection for Robust QA
arXiv의료 질문 답변(QA)에서 희소한 근거 정보(Rationale)를 활용하기 위해, 연구진은 RMS-RSP라는 효율적인 샘플 선택 기법을 제시했습니다.
세 줄 요약
- 이 방법은 답변 옵션 재배열 같은 형식 변화에 강인하여, 모델의 견고한 정확도 및 의미적 일관성 향상을 입증했습니다.
- 단순 성능 향상을 넘어, 해설 기반 학습이 모델에 형식적/조건적 변화에 흔들리지 않는 ‘불변성’을 부여하는 핵심 방식을 제시합니다.
- 다만, 모든 근거 정보를 무분별하게 사용하면 과도한 자원 소모만 초래할 수 있으므로, 신중하고 전략적인 샘플 선택이 중요합니다.
의료 질문 답변(QA) 데이터셋은 정답 레이블은 포함하고 있으나, 고품질의 근거 정보(Rationale)는 부족하거나 검증 비용이 높은 문제가 있습니다. 이에 따라 본 연구는 어떤 질문에 라벨링을 할지 결정하는 대신, 이미 라벨링된 질문 중 제한된 예산 내에서 어느 질문에 근거 정보 감독(supervision)을 적용할지 선택하는 방식을 제안합니다.
연구진은 'RMS-RSP'라는 방법론을 제시하여, 근거 정보 토큰에서만 은닉 상태를 교란시키고 그로 인해 발생하는 변화를 측정했습니다. 다섯 가지 의료 QA 데이터셋에 걸쳐 테스트한 결과, RMS-RSP는 제한된 예산 내에서 평균 60.61%의 정확도를 보였으며, 이는 무작위 선택(Random) 방식의 60.08%보다 높은 수치였습니다.
특히 답변 옵션 재배열과 같은 형식적 변화가 발생했을 때, RMS-RSP는 견고한 정확도와 의미적 일관성을 각각 평균 1.91점 및 2.85점 향상시키는 것으로 나타났습니다. 이는 모든 근거 정보를 학습에 사용하는 것보다 전략적인 샘플 선택이 모델의 형식적 변화에 대한 불변성(invariance)을 개선하는 데 효과적임을 시사합니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.