법률 텍스트 분석에서 불용어 제거가 데이터 왜곡을 일으킬 수 있다 — AI 생성 일러스트AI 일러스트
리서치 연구

법률 텍스트 분석에서 불용어 제거가 데이터 왜곡을 일으킬 수 있다

Stop Removing Stopwords: How an Inherited Preprocessing Default Distorts Legal Text-as-Data

arXiv9월 18일 발표 · 2분 · 심사 전 논문

법률 텍스트를 데이터로 분석할 때, 오랫동안 사용된 전처리 과정(특히 불용어 제거)이 모델이 포착해야 할 핵심적인 법적 신호를 왜곡시킬 수 있다는 연구 결과가 나왔습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 대규모 실험을 통해 일반적이거나 최적화된 불용어 목록 모두 '제거하지 않은 경우'와 통계적으로 차이가 없으며, 성능 향상에 기여하는 전처리 단계를 예측하기 어렵다는 점이 입증되었습니다.
  2. 이는 법률 AI 개발자들에게 경고합니다. 사소해 보이는 전처리 과정 하나가 모델의 해석적 유효성(Interpretability)을 심각하게 저해하여 연구 결과를 오도할 수 있기 때문입니다.
  3. 따라서 법학 및 자연어 처리 분야에서 텍스트 데이터를 분석할 때는, 불용어 제거 같은 기본 설정을 그대로 사용하기보다 해당 단계가 측정의 타당성에 미치는 영향을 반드시 검토해야 합니다.

법학 분야의 학술 연구는 사법부 텍스트를 데이터로 다루며, 주로 TF-IDF 특징과 선형 분류기 같은 희소하고 해석 가능한 파이프라인에 의존합니다. 이러한 파이프라인들은 전처리 과정에서 불용어 제거와 같이 중반 정보 검색 시대부터 이어진 기본 설정을 물려받았으나, 이는 분류 정확도 측면에서 검증된 적이 없습니다.

연구진은 '단일 단어 제거(single-word ablation)'라는 방법을 도입하여 특정 전처리 단계가 다운스트림 목표에 미치는 영향을 직접 측정했습니다. 이 방법론을 법률 데이터에 적용하여, 사법부 판례 의견 텍스트(7,668개 및 7,001개)를 대상으로 이념적 방향성이나 헌법/비헌법 법 유형과 같은 두 가지 이진 분류 작업을 분석했습니다.

분석 결과, 일반적으로 사용되는 불용어 목록은 모든 테스트에서 '제거하지 않은 경우'보다 낮은 성능을 보였으며, 심지어 최적화된 불용어 목록조차 제거하지 않은 경우와 통계적으로 구별하기 어려웠습니다. 또한, 단어 수준의 특징으로 훈련된 메타 모델로는 어떤 전처리 과정이 도움이 될지 예측할 수 없다는 결론에 도달했습니다.

원문arXiv · Stop Removing Stopwords: How an Inherited Preprocessing Default Distorts Legal Text-as-Data같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv