리서치 연구
Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos
ARarXiv
긴 영상에서 질문에 답할 때, 관련 증거가 부족하고 정답과 오답을 구분하는 결정적인 단서(cue)를 찾는 것이 핵심 난제입니다.
세 줄 요약
- 연구진은 'PACE' 프레임워크를 제안했습니다. 이는 질문 요소를 이용해 영상을 인덱싱한 후, 후보 답변을 바탕으로 대조적 단서를 추출하여 증거를 검증하는 2단계 방식입니다.
- 이 기술은 단순히 영상의 주제와 관련된 증거를 찾는 것을 넘어, 오답과 정답을 명확히 구분하는 결정적인 단서 확보에 초점을 맞춰 장기 비디오 이해 AI 성능을 혁신합니다.
- 실험 결과, 성능 향상은 답변 지식 강화가 아닌 실제 필요한 증거 복구 능력 덕분임이 입증되었으며, 여러 벤치마크에서 우수한 범용성을 보여줍니다.
긴 영상에서 질문에 답할 때, 관련 증거가 부족하고 정답과 오답을 구분하는 결정적인 단서(cue)를 찾는 것이 핵심 난제입니다.