법률 문서 분류 모델의 공정성과 설명 신뢰도 분석
SCM-based Fairness and Faithful Explainability for Legal Document Classification
arXiv법률 문서 분류 모델의 공정성 개선 작업이 모델 설명력 같은 투명성 속성에 미치는 영향을 분석한 연구입니다.
AI 모델을 개발할 때 공정성을 높이는 작업이 반드시 설명 가능성까지 보장하지 않기 때문에, 두 가지 속성을 분리해서 평가해야 한다는 점을 알려줘요.
- 공정성을 높이는 개입은 성능 저하 없이 차별 해소에 성공했으나, 모델의 설명 신뢰도는 지속적으로 떨어지는 문제가 발견되었습니다.
- 이 결과는 인공지능 모델에서 공정성과 설명 가능성이 반드시 연결된 관계가 아님을 보여주며, 두 속성을 분리하여 평가해야 함을 시사합니다.
- 따라서 AI 모델의 공정성 여부를 판단할 때는 설명 방식의 변화에 의존하지 않고 직접적인 지표를 통해 검증하는 것이 중요합니다.
LegalBERT와 같은 기반 모델이 법률 결정 지원 분야에서 사용되면서, 모델의 공정성(fairness)과 설명 투명성에 대한 우려가 커지고 있다. 기존 연구들은 이 두 가지 속성을 개별적으로 평가하는 경향이 있어, 공정성 개선을 위한 개입이 모델 설명의 충실도(faithfulness)에 어떤 영향을 미치는지 명확히 알기 어려웠다.
본 연구는 LexGLUE의 ECtHR 위반 주장 코퍼스를 활용하여 LegalBERT를 비교 분석했다. 이 과정에서 스테레오타입적 따뜻함과 역량 표현을 페널티화하는 공정성 정규화 변형 모델을 했으며, 예측 성능, 인구통계학적 공정성, 그리고 SHAP 설명의 충실도를 다섯 개의 무작위 시드에 걸쳐 평가했다.
분석 결과, 최적의 정규화 강도에서 개입은 인구통계학적 격차를 줄이지 않았고 분류 성능 변화 역시 크지 않았다. 하지만 이 공정성 개선 개입은 모든 시드와 임계값에서 설명의 충분성을 지속적으로 저하시키는 문제가 발견되었다. 이는 AI 모델에서 공정성과 설명 신뢰도가 반드시 연결된 관계가 아니며, 두 속성은 독립적으로 평가되어야 함을 보여준다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 파인튜닝
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
어떤 데이터를 사용해서 공정성 개선 작업을 진행했나요?
LexGLUE의 ECtHR 위반 주장 코퍼스를 활용했어요. 이 과정에서 스테레오타입적 따뜻함과 역량 표현을 페널티화하는 공정성 정규화 변형 모델을 파인튜닝하고, 예측 성능, 인구통계학적 공정성, SHAP 설명의 충실도를 평가했답니다.
공정성을 개선했을 때 모델 설명력은 어떻게 변했나요?
공정성 개선 개입을 했음에도 불구하고, 모든 시드와 임계값에서 모델의 설명 충분성이 지속적으로 저하되는 문제가 발견되었어요. 이는 공정성과 설명 신뢰도가 반드시 연결된 관계가 아니라는 것을 보여줍니다.
공정성과 설명 가능성을 분리해서 평가해야 하는 이유는 무엇인가요?
AI 모델에서 공정성 개선을 위한 개입이 반드시 모델의 설명 충실도에 영향을 미치지 않기 때문이에요. 따라서 두 속성은 독립적으로 평가되어야 하며, 공정성 여부를 판단할 때는 설명 방식 변화에 의존하지 않는 것이 중요합니다.