비디오 LLM의 움직임 이해 능력 검증: MotionBlind 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

비디오 LLM의 움직임 이해 능력 검증: MotionBlind 연구

MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs

arXiv9월 10일 발표 · 2분 · 심사 전 논문

비디오-LLM이 움직임의 속도나 방향 같은 물리적 요소를 이해하는지 검증하기 위해 'MotionBlind'라는 새로운 벤치마크가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 테스트 결과, 현존하는 대부분의 모델은 미세한 움직임 차이를 구분하지 못했으며, 단순히 모델 크기를 키우는 것만으로는 성능 향상이 어려웠습니다.
  2. 이 연구는 AI가 단순한 시각적 패턴 인식을 넘어, 실제 물리 세계의 원리를 이해해야만 신뢰할 수 있는 '세계 모델'로 기능할 수 있음을 보여줍니다.
  3. 성공적인 움직임 분석을 위해서는 비디오 입력과 정확한 시간 순서가 필수적이며, 프레임 수 증가만으로는 근본적인 한계를 극복하기 어렵습니다.

Video-s는 세계 모델의 시각적 전면부로 활용되며, 사물이 얼마나 빠르게 이동하는지, 어느 방향으로 움직이는지 등 움직임을 읽어낼 수 있다고 가정됩니다. 이에 연구진은 물리적으로 근거한 움직임(속도, 크기, 방향)을 검증하기 위해 MotionBlind라는 대조적 를 도입했습니다. 이 벤치마크는 운동만 다른 거의 동일한 비디오 클립 쌍을 사용하여 모델의 이해도를 측정합니다.

MotionBlind 테스트에서는 각 인스턴스가 네 가지 질문으로 구성되어 있으며, 모델이 모든 질문에 정확히 답해야 점수를 얻습니다. 연구진은 총 여섯 개의 오픈 모델과 두 개의 최첨단 Video-LLM을 대상으로 실험을 진행했습니다. 그 결과, 대부분의 오픈 모델들은 6.25%라는 낮은 확률 바닥(chance floor) 근처에서 성능을 보였으며, 단순히 모델 크기를 키우는 것만으로는 성능 향상을 기대하기 어려웠습니다.

테스트 결과에 따르면, 비디오 입력 자체를 제거하거나 프레임을 시간 순서가 아닌 무작위로 샘플링할 경우 모든 모델의 IAcc 점수는 급격히 떨어졌습니다. 이는 움직임 이해를 위해서는 비디오와 정확한 시간적 순서가 필수적임을 보여줍니다. 심지어 Gemini3.1 Pro 같은 최신 모델조차 속도 차이를 구분하는 데 실패하여, 아직 세계 모델로 신뢰하기 어렵다는 결론을 내렸습니다.

용어 풀이

벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv