질문과 정답 기반 비디오 프레임 선별 기법 연구
Query-aligned video frame selection for long video understanding
arXiv대규모 멀티모달 언어 모델(MLLM)이 긴 비디오를 이해할 때, 질문과 답안 선택지를 활용하여 가장 관련성 높은 프레임만 선별하는 새로운 방법을 제시했습니다.
- 제안된 방식은 답변 추론 시 답안지에서 얻은 의미적 단서를 직접 사용하며, 기존의 균일 샘플링보다 월등히 뛰어난 성능을 입증했습니다.
- 이 기술은 질문과 선택지를 기반으로 비디오 콘텐츠의 관련 증거를 선별하여 MLLM의 이해도를 극대화하고 효율성을 높입니다.
- 고정된 토큰 예산 내에서 작동하며, MLVU, Video-MME 등 다양한 벤치마크와 여러 MLLM 모델을 통해 그 효과가 검증되었습니다.
(MLLMs)은 텍스트, 이미지, 비디오 등 다양한 모달리티를 시퀀스로 변환하여 처리합니다. MLLMs가 개별 이미지를 이해하는 데는 뛰어난 성능을 보이지만, 영상은 프레임 수가 매우 많아 비디오 이해는 여전히 어려운 과제입니다. 기존의 MLLMs는 일반적으로 질문과 무관하게 8개에서 64개 사이의 프레임을 균일하게 샘플링하는 경향이 있습니다.
본 연구에서는 다중 선택형 질문에 특화된 프레임 선별 방법을 제시합니다. 이 방법은 답변 선택지로부터 얻은 의미적 단서를 질문 텍스트에 추가하고, 직접적인 질의-프레임 정렬 점수 계산 메커니즘을 사용합니다. 후보 프레임 풀을 고정 비율로 서브샘플링한 후, 모든 질문-답변 쌍에 걸친 최대 코사인 유사도를 기준으로 각 프레임을 점수화하여 주어진 질문과 가장 관련성 높은 프레임을 식별합니다.
제안된 프레임 선별 방법의 효과는 MLVU, Video-MME, LongVideoBench 에서 LLaVA-Mini, Qwen2-VL, LLaVA-Video 등 세 가지 MLLMs를 사용하여 평가되었습니다. 실험 결과에 따르면, 답변을 고려한 프레임 선택 방식은 동일한 프레임 예산 하에서 기존의 균일 샘플링이나 다른 학습 기반 프레임 선별 방법보다 전반적으로 우수한 성능을 보였습니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.