리서치 연구
SemEval-2025 기반 텍스트 감정 분석 성능 개선 연구
YNU-HPCC at SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Using Multiple Prediction Headers
arXivYNU-HPCC 팀이 SemEval-2025 감정 분석 과제에 참여하여, RoBERTa 모델을 개선하고 단일 예측 헤드를 활용한 시스템으로 높은 성능(0.44)을 달성했습니다.
세 줄 요약
- 연구 결과, 여러 감정을 동시에 예측하는 것보다 하나의 감정에 집중하는 것이 유리했으며, 원문 데이터 대신 영어로 통일 번역된 데이터셋이 더 좋은 성능을 보였습니다.
- 이는 복잡한 다중 레이블 과제에서도 모델 구조를 단순화하고 전처리 방식을 표준화하는 접근법이 높은 정확도를 달성할 수 있음을 시사합니다.
- 다만, 최적 성능이 번역된 영어 데이터에서 나왔으므로, 다국어 원문 데이터를 그대로 사용할 경우 성능 저하가 발생할 위험을 염두에 두어야 합니다.
YNU-HPCC 팀은 SemEval-2025의 Task 11 Subtask A인 'Bridging the Gap in Text-Based Emotion' 과제에 참여했다. 이 연구에서 사용된 시스템은 RoBERTa 모델을 기반으로 하며, 인코더 아키텍처를 활용한 BERT의 개선 버전이다. 특히 출력 헤드를 강화하여 모델이 단일 감정을 동시에 처리할 수 있도록 구조를 개선했으며, 모든 언어 결과를 포함하여 공식 순위 점수 0.44를 달성했다.
연구팀은 확률적 및 어텐션 분석을 통해 두 가지 주요 발견을 했다. 첫째, 여섯 가지 감정을 동시에 예측하는 다중 헤드 방식보다 단일 예측 헤드를 사용하는 것이 더 나은 성능을 보였다. 둘째, 원본 데이터셋을 활용하는 것보다 균일하게 번역된 영어 데이터셋으로 학습했을 때 더 좋은 결과를 얻는 것으로 나타났다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.