자아중심 영상의 에피소드 기억을 위한 캡션 기반 평가 기준 'CapMem' 개발
CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video
arXiv웨어러블 기기용 자아중심 영상의 장기 기억 구현을 위해, 텍스트 캡션을 활용한 새로운 평가 기준 'CapMem'이 개발되었습니다.
- 연구 결과, 긴 영상을 다룰 때 단순 비디오 QA보다 전체 맥락을 아우르는 캡션 기반 질의응답 방식이 월등히 높은 성능을 보였습니다.
- 이는 대규모 언어 모델(LLM)이 직면하는 장기 컨텍스트 처리의 어려움과 비용 문제를 캡션 메모리가 효과적으로 해결할 수 있음을 시사합니다.
- CapMem은 총 33.7시간 분량의 데이터를 기반으로 하며, 특히 캡션을 검색하고 검증하는 과정에서 높은 성능 향상을 입증했습니다.
웨어러블 보조 장치는 자아중심 비디오에 대한 에피소드 메모리가 필요하지만, 현재의 비전-언어 모델()은 제한된 프레임 예산, 증가하는 시각 비용, 그리고 장기 컨텍스트 검색 실패 등의 문제에 직면합니다. 이에 연구진은 텍스트 캡션이 재사용 가능한 에피소드 메모리 역할을 할 수 있는지 탐구하며 '에피소드 메모리 비디오 캡션 QA' 과제를 정의하고 CapMem이라는 새로운 평가 기준을 제시했습니다.
CapMem은 인간이 주석을 단 평가 기준으로, 총 75개의 영상과 33.7시간 분량의 데이터를 포함합니다. 이 는 16가지 시나리오에 걸쳐 1,000개의 객관식 질문으로 구성되어 있으며, 장기적인 자아중심 비디오에서의 에피소드 추론 능력을 측정하는 데 사용됩니다.
실험 결과, 20분 이상의 긴 영상에 대해 전체 커버리지(full-coverage)의 캡션 QA 방식은 각각 10/12 및 8/12 모델에서 직접적인 비디오 QA보다 우수한 성능을 보였습니다. 또한, 여섯 개의 Qwen 모델을 대상으로 한 매치드 프레임 제어에서는 평균 정확도 향상 폭이 각각 3.22점과 2.55점을 기록했으며, 캡션 기반 검색 및 검증 장치를 추가하여 최대 5.3점까지 정확도가 개선됨을 입증했습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.