모델 연구
Video2Reaction: Training Foundation Video Models to Predict Audience Reaction
ARarXiv
영상 클립과 이를 본 사람들의 실제 감정 반응을 연결한 대규모 멀티모달 데이터셋 'Video2Reaction'이 공개되어 주목받고 있습니다.
세 줄 요약
- 이 데이터셋으로 학습된 비전-언어 모델(VLM)은 높은 예측 성능을 보였으며, 다른 종류의 감정 데이터셋에도 적은 양만으로 뛰어난 전이 능력을 입증했습니다.
- 영상 기반의 정교한 감정 분석이 가능해지면서, 미디어 콘텐츠 기획 단계부터 시청자 반응을 사전에 예측하는 것이 중요해질 전망입니다.
- 소셜 미디어 댓글에서 수집된 '야생' 데이터를 활용하여, 인간 감정의 주관성과 모호성을 분포 형태로 모델링한 점이 핵심 특징입니다.
영상 클립과 이를 본 사람들의 실제 감정 반응을 연결한 대규모 멀티모달 데이터셋 'Video2Reaction'이 공개되어 주목받고 있습니다.