리서치 연구

Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales

ARarXiv8월 28일 발표 · 1분 · 심사 전 논문

본 연구는 다국어 혐오 발언 탐지 시 모델 추론을 인간의 설명과 일치시키는 학습 시간 설명 가능성 프레임워크를 제안했다.

세 줄 요약arXiv 원문 기반
  1. HateXplain(영어)과 BullySent(힌글리시) 데이터셋으로 평가했으며, 기울기 및 어텐션 기반 정규화가 F-점수를 개선하고 해석력을 높였다.
  2. 이 방법은 문화적 맥락을 반영하여 암묵적인 반무슬림 혐오를 탐지하는 길을 열어준다.
  3. 평가는 LIME, Integrated Gradients, Grad X Input, 어텐션 등을 사용해 정확도와 설명 품질을 측정했다.

본 연구는 다국어 혐오 발언 탐지 시 모델 추론을 인간의 설명과 일치시키는 학습 시간 설명 가능성 프레임워크를 제안했다.

원문arXiv · Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기