반사실적 주변화: 잡음 변수 강건성 평가 프레임워크
Counterfactual Marginalisation: Framework for Evaluating Robustness to Nuisance Variables
arXiv기계 학습 모델이 나이, 성별 같은 잡음 변수(Nuisance Variables)에 의존하여 성능을 내는 문제를 해결하기 위한 새로운 평가 프레임워크가 제안되었습니다.
- 핵심은 가상 이미지 생성기를 이용해 특정 변수를 개입시키고 예측값을 평균화함으로써, 잡음 변수의 영향을 제거한 '개입 인식 예측'을 도출하는 것입니다.
- 이러한 정량적 평가는 모델의 공정성(Fairness)과 신뢰성을 객관적으로 측정할 수 있게 하여, 편향되거나 취약한 AI 시스템 개선에 필수적인 기준을 제공합니다.
- 이를 통해 CF 위험도, 안정성 등 다양한 측면의 성능 지표를 정의하고 모델의 견고성(Robustness)을 종합적이고 체계적으로 평가할 수 있습니다.
기계 학습 모델이 인구통계학적 또는 획득 관련 단축 경로(shortcuts)에 의존하여 높은 테스트 성능을 달성하는 문제가 제기됩니다. 이에 본 논문은 이러한 변수들에 대한 분류 모델의 강건성을 평가하기 위한 새로운 방법론으로 '반사실적 주변화(Counterfactual Marginalisation)'를 제안합니다. 이 프레임워크는 모델이 잡음 변수에 의존하는 문제를 해결하고, 보다 객관적인 성능 평가 기준을 제시하는 것을 목표로 합니다.
제안된 방법은 가상 이미지 생성기(CF image generator)를 활용하여 나이 또는 성별과 같은 잡음 부모 변수(nuisance parent variables)에 개입합니다. 테스트 이미지 각각에 대해 반사실적 버전을 생성하고, 이를 특정 개입 분포(target intervention distribution) 위에서 예측값을 평균화하는 과정을 거칩니다. 이 과정은 인구통계학적 영향을 주변화하면서도 환자 고유의 잠재 정보를 보존한 '개입 인식 예측'을 도출합니다.
이러한 개입 인식 예측값들은 모델의 강건성을 정량적으로 평가하기 위한 다양한 지표를 정의하는 데 사용됩니다. 구체적으로 CF 위험(CF risk), 보정(calibration), 안정성(stability) 및 최악 사례 민감도(worst-case sensitivity) 등의 측면에서 성능을 측정할 수 있으며, 이를 통해 모델의 견고성을 종합적이고 체계적으로 평가할 수 있습니다.