리서치 연구
Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales
ARarXiv
본 연구는 다국어 혐오 발언 탐지 시 모델 추론을 인간의 설명과 일치시키는 학습 시간 설명 가능성 프레임워크를 제안했다.
세 줄 요약
- HateXplain(영어)과 BullySent(힌글리시) 데이터셋으로 평가했으며, 기울기 및 어텐션 기반 정규화가 F-점수를 개선하고 해석력을 높였다.
- 이 방법은 문화적 맥락을 반영하여 암묵적인 반무슬림 혐오를 탐지하는 길을 열어준다.
- 평가는 LIME, Integrated Gradients, Grad X Input, 어텐션 등을 사용해 정확도와 설명 품질을 측정했다.
본 연구는 다국어 혐오 발언 탐지 시 모델 추론을 인간의 설명과 일치시키는 학습 시간 설명 가능성 프레임워크를 제안했다.