설명 가능한 혐오 발언 탐지 프레임워크 제안 — AI 생성 일러스트AI 일러스트
리서치 연구

설명 가능한 혐오 발언 탐지 프레임워크 제안

An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection

arXiv9월 25일 발표 · 3분 · 심사 전 논문

소셜 미디어 콘텐츠 모더레이션의 핵심 과제인 혐오 발언 탐지를 위해, 성능과 투명성을 결합한 새로운 다단계 프레임워크를 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. DistilBERT와 Bi-LSTM 구조에 Attention 메커니즘을 결합했으며, LIME 기법을 활용해 예측의 근거를 명확히 제시하는 것이 특징입니다.
  2. 단순한 높은 정확도를 넘어, 결정 과정을 투명하게 설명함으로써 실제 운영되는 콘텐츠 관리 시스템의 신뢰성과 실용성을 높였습니다.
  3. 이 프레임워크는 바이너리 및 다중 클래스 등 다양한 조건에서 높은 F1 점수를 기록하며 뛰어난 성능과 범용성을 입증했습니다.

소셜 미디어의 혐오 발언은 사회적 조화와 공공 안전에 심각한 위험을 초래하므로, 정확하고 시기적인 콘텐츠 모더레이션 시스템 구축이 필수적입니다. 기존 연구들은 주로 이진 분류(binary classification)에 집중하거나 단일 데이터셋에서 평가가 이루어져 실질적인 적용에 한계가 있었습니다. 본 연구는 이러한 문제를 해결하기 위해 다단계의 설명 가능한 혐오 발언 탐지 프레임워크를 제안했습니다.

제안된 모델은 DistilBERT 을 Bi-LSTM(Bidirectional Long Short-Term Memory) 구조와 어텐션 메커니즘에 통합하여, 텍스트 내 문맥적 의미와 순차적 의존성을 모두 포착합니다. 특히 신뢰성과 투명성을 높이기 위해 LIME(Local Interpretable Model-agnostic Explanations) 기법을 활용하여 모델의 예측 근거를 설명함으로써 실용적인 콘텐츠 관리 시스템에 적합하도록 설계되었습니다.

이 프레임워크는 바이너리 및 다중 클래스 분류 환경에서 두 가지 데이터셋(Davidson, SMHS)으로 평가되었으며 뛰어난 성능을 입증했습니다. 이진 분류의 경우 Davidson 데이터셋에서 F1-점수 96.78%, SMHS 데이터셋에서 99.53%를 달성했으며, 다중 클래스 환경에서는 각각 97.00%와 94.99%의 F1-점수를 기록하며 기존 기준 모델들을 능가했습니다.

용어 풀이

임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv