웨어러블 센서 기반 생리적 감정 인식 비교 연구 결과
From Stress to Affect: Multimodal Deep Learning for Physiological Emotion Recognition Across Wearable Sensor Modalities
arXiv웨어러블 센서를 활용하여 생리적 신호를 측정하고 감정을 인식하는 기술의 성능을 다각도로 분석한 비교 연구가 진행되었습니다.
- 특정 딥러닝 아키텍처가 모든 상황에서 우수하지 않으며, 데이터셋 특성에 따라 최적 모델이 달라지지만, 여러 센서를 결합한 다중 모드 방식이 가장 효과적이었습니다.
- 이 결과는 감정 인식 시스템 개발 시, 사용 목적과 환경에 맞는 최적의 AI 아키텍처와 센싱 방식을 선택하는 실질적인 지침을 제공합니다.
- 샘플링 주파수는 지나치게 높을 필요가 없으며, 4Hz 정도만 유지해도 높은 성능을 기대할 수 있어 학습 비용 절감 측면에서 매우 효율적입니다.
본 연구는 웨어러블 센서를 활용한 생리적 감정 인식을 위해 WESAD와 EmoWear 두 가지 다중 모드 데이터셋을 사용하여 비교 분석을 수행했습니다. 참가자 독립적인 leave-one-subject-out cross-validation (LOSO-CV) 방식을 적용하여, Bi-LSTM, TCN, Transformer 등 여러 시계열 딥러닝 아키텍처를 평가했습니다. 이 과정에서 손목 전용, 가슴 전용, 그리고 다중 모드 센싱 구성의 성능을 비교 분석하였습니다.
연구 결과에 따르면, 특정 아키텍처가 모든 상황에서 우수하지 않으며 상대적인 성능은 데이터셋 특성에 따라 달라지는 것으로 나타났습니다. 특히 다중 모드 센싱이 두 데이터셋 모두에서 손목 전용 및 가슴 전용 구성보다 일관되게 높은 성능을 보였습니다. WESAD에서는 Transformer가 99.02% +/- 0.51%의 최고 다중 모드 정확도를 기록했으며, EmoWear에서는 LSTM이 각성도(91.80% +/- 1.06%)와 가치(89.96% +/- 0.36%) 모두에서 최고의 성능을 달성했습니다.
또한 샘플링 주파수 분석 결과, 4 Hz가 실용적인 작동 지점임을 확인했습니다. 이 주파수는 학습 비용이 현저히 낮으면서도 더 높은 주파수와 비교 가능한 성능을 제공하는 것으로 나타났습니다. 이러한 발견들은 웨어러블 생리적 감정 인식 시스템 개발 시 아키텍처, 센싱 방식 및 적절한 샘플링 주파수를 선택하는 데 실질적인 지침을 제시합니다.