이벤트 그래프와 필드를 활용한 해석 가능한 비디오 추론
Interpretable Temporal Video Reasoning with EventGraph and EventField
arXiv복잡한 영상 속 시간 변화를 분석하기 위해, 이벤트를 '그래프'와 '필드'로 구조화하고 사람 눈에 보이는 형태로 구현한 새로운 추론 시스템을 제안했습니다.
- 실제 실험에서 이 구조화된 모델은 단순 캡션 기반이나 VLM 단독 사용 방식보다 높은 정확도를 기록하며, 영상의 시간적 흐름을 효과적으로 파악함을 증명했습니다.
- 특히 중요한 것은 단순히 높은 성능을 넘어, 이벤트 그래프와 시각화된 글리프를 통해 AI의 추론 과정을 사람이 직접 확인하고 이해할 수 있다는 해석 가능성을 확보했다는 점입니다.
- 결론적으로, 본 연구는 구조화된 시간적 표현 방식이 뛰어난 성능은 물론 추론 과정의 투명성까지 보장하여, 비디오 AI 기술의 신뢰도 향상에 크게 기여할 것으로 기대됩니다.
본 연구는 이산적인 이벤트 그래프, 연속적인 이벤트 필드, 그리고 사람이 읽을 수 있는 이벤트 글리프 뷰를 중심으로 구조화된 시간적 비디오 추론 파이프라인을 제시합니다. 이 시스템은 복잡한 영상 속의 시간 변화를 분석하며, 단순히 성능 향상뿐만 아니라 AI가 어떤 과정을 거쳐 결론에 도달했는지 사람이 이해할 수 있는 해석 가능성(Interpretability)을 확보하는 데 중점을 둡니다.
실험 결과, 제안된 EventField+Glyph는 10개의 비디오와 50개의 시간적 추론 질문으로 구성된 EPIC-KITCHENS의 보정된 서브셋에서 0.98의 전체 정확도를 달성했습니다. 이 수치는 단순 캡션 기반 방식보다 +0.40 높았으며(paired p = 1.1 \times 10^{-5}), 직접적인 단독 QA 방식보다도 +0.20 높은 성능을 기록하며 구조화된 시간적 표현의 우수성을 입증했습니다.
연구 결과는 구조화된 시간적 표현이 상징적 구조를 보존하고, 시간적 연속성을 포착하며, 비디오 추론에 대한 사람이 읽기 쉬운 진단(diagnostics)을 제공함으로써 성능과 검사 가능성(inspectability)을 동시에 지원할 수 있음을 보여줍니다. 이는 비디오 AI 기술의 신뢰도 향상에 기여하는 핵심 요소로 작용합니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.