AI 정책 연구
StreamScout: Learning When to Look Deeper for Streaming Video Understanding
ARarXiv
스트리밍 비디오 이해는 무한히 흐르는 영상에서 임의 시점에 질문에 답해야 하는 과제입니다. StreamScout은 필요한 정보량에 따라 추론 깊이를 조절하는 적응형 프레임워크를 제시합니다.
세 줄 요약
- 이 모델은 가벼운 텍스트 타임라인을 유지하며, 질문 발생 시 최근 장면 확인부터 과거 전체 탐색까지 단계적으로 정보를 확장하는 '멈춤-상향' 정책을 사용합니다.
- 기존 방식 대비 추론 비용과 토큰 사용량을 대폭 줄였음에도 높은 성능을 보입니다. OVO-Bench에서 균일 샘플링보다 적은 토큰으로 더 나은 결과를 입증했습니다.
- 핵심은 단순히 메모리를 저장하는 것이 아니라, 질문의 성격에 따라 접근 깊이를 조절하는 '적응형 정책' 설계가 가능하다는 점입니다.
스트리밍 비디오 이해는 무한히 흐르는 영상에서 임의 시점에 질문에 답해야 하는 과제입니다. StreamScout은 필요한 정보량에 따라 추론 깊이를 조절하는 적응형 프레임워크를 제시합니다.