리서치 연구

From Visual Cues to Spoken Narration: Rethinking Audio Description

ARarXiv9월 3일 발표 · 1분 · 심사 전 논문

기존 오디오 설명(AD) 기술은 영상 클립 단위로만 처리하여 시간적 맥락을 놓치는 한계가 있었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진이 개발한 'Cue2Narrate'는 오디오와 비주얼 정보를 결합해 AD를 생성할 시점과 내용을 공동으로 예측하는 새로운 방식을 제시했습니다.
  2. 이는 장편 영화에 특화된 다중 세그먼트 AD 생성을 위한 최초의 벤치마크(LongLSMDC)를 구축하며 접근성 향상에 기여합니다.
  3. 본 연구는 단순히 정보를 전달하는 것을 넘어, 사용자가 가장 자연스럽게 이해할 수 있도록 최적화된 미디어 경험을 제공하는 새로운 표준을 제시했습니다.

기존 오디오 설명(AD) 기술은 영상 클립 단위로만 처리하여 시간적 맥락을 놓치는 한계가 있었습니다.

원문arXiv · From Visual Cues to Spoken Narration: Rethinking Audio Description같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기