리서치 연구
Cross-Platform Generalisation Failure in Mental Health Natural Language Processing: A Five-Axis Fairness Audit of Transformer Models on Social Media
ARarXiv
연구진은 정신 건강 자연어 처리 모델의 플랫폼 간 일반화 실패를 다섯 축으로 감사하는 CPFE 프레임워크를 제시했다.
세 줄 요약
- BERT, RoBERTa 등 세 모델 모두 Reddit과 Twitter에서 AUC가 현저히 떨어지고 ECE도 크게 상승하는 것이 확인됐다.
- 이러한 결과는 정신 건강 NLP 시스템 구축 시 플랫폼 간 검증을 다섯 가지 축으로 표준 요구사항으로 삼아야 함을 보여준다.
- 평균 AUC 개선은 0.216이었으며, 이는 목표 플랫폼 레이블이 보정 신호보다 학습 신호로 더 큰 이점을 제공함을 시사한다.
연구진은 정신 건강 자연어 처리 모델의 플랫폼 간 일반화 실패를 다섯 축으로 감사하는 CPFE 프레임워크를 제시했다.