활용 사례 연구
Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning
ARarXiv
영상 속 여러 이벤트를 자동으로 찾아 설명하는 '밀집 비디오 캡셔닝' 분야의 최신 연구입니다.
세 줄 요약
- 제안된 'SBS' 프레임워크는 VLM을 활용해 이벤트 간 공백에 대한 시각적 서술을 생성하고, 의미 변화 지점을 포착하여 시간 마스크를 정교하게 수정합니다.
- 이 기술은 영상 속 복잡한 행동 변화를 높은 정확도로 포착하여, 미디어 콘텐츠 분석 및 자동화된 설명 기능 발전에 기여할 것입니다.
- ActivityNet Captions와 YouCook2 데이터셋 실험에서 캡셔닝과 위치 파악(Localization) 모두에서 최고 수준의 성능을 입증했습니다.
영상 속 여러 이벤트를 자동으로 찾아 설명하는 '밀집 비디오 캡셔닝' 분야의 최신 연구입니다.