시간적 분할과 의미 추상화를 통한 절차 이해 프레임워크
A Framework for Egocentric and Exocentric Procedural Understanding via Temporal Segmentation and Semantic Abstraction
작업장 환경의 길고 복잡한 비디오 데이터를 분석하여, 일어난 절차적 과정을 구조화된 '절차 상태 메모리'로 변환하는 프레임워크를 제안했습니다.
복잡하고 방대한 작업장 비디오 데이터를 개인 정보 보호가 중요한 환경에서도 구조화된 형태로 검색 가능하게 만들어 줘요.
- 이 시스템은 시각적 맥락이나 움직임 변화 등을 감지해 영상을 이벤트 단위로 분할하고, 각 이벤트를 상세한 증거 카드에 기록하여 작업 환경 모델을 구축합니다.
- 방대한 비디오 데이터를 압축적으로 문서화하고 검색 가능하게 만들면서도, 온프레미스 환경에서 개인 정보 보호 제약을 지킬 수 있다는 점이 핵심 강점입니다.
- 구현에는 DINOv2와 VJEPA-2 인코더 및 로컬 언어 모델 등이 사용되었으며, 분할 품질과 메모리 압축률 등 다각적인 평가가 이루어졌습니다.
장기간의 작업 환경 비디오 데이터는 풍부한 절차적 증거를 포함하고 있지만, 동시에 중복되고 노이즈가 많으며 처리 및 보존 비용이 높다는 문제가 있습니다. 이에 연구진은 연속적인 작업장 영상을 구조화된 '절차 상태 메모리(Procedural State Memory)'로 변환하는 간결한 프레임워크를 제안했습니다. 이 시스템은 '작업 환경 모델(Work Environment Model, WEM)' 형태로 구현됩니다.
이 프레임워크는 이벤트 분할 이론에서 영감을 받아 작동하며, 고정된 시간 창이나 시각적 참신성만을 이용하는 대신, 시각적 맥락, 위치 변화, 움직임, 나레이션, 시선/사물 상호작용 및 선택적인 외지(exocentric) 작업장 증거의 변화를 감지하여 경계를 탐지합니다. 각 세그먼트는 행위자, 간격, 위치, 행동, 사물/도구, 전후 상태, 신뢰도, 출처 등을 포함하는 증거 기반 이벤트 카드로 추상화됩니다.
이러한 이벤트 카드들은 WEM을 점진적으로 업데이트하여, 온프레미스 개인 정보 보호 제약 조건 하에서도 간결하고 감사 가능한 문서화 및 검색 기능을 가능하게 합니다. 시스템 구현에는 동결된 DINOv2와 VJEPA-2 인코더, 그리고 로컬 언어 모델이 사용되었으며, 평가 기준으로는 분할 품질, 메모리 압축률, 검색 충실도, 장기 시퀀스 질의응답(QA) 등이 제시되었습니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
장시간 작업장 비디오 데이터의 문제는 무엇인가요?
풍부한 절차적 증거를 담고 있지만, 동시에 중복되고 노이즈가 많으며 처리와 보존에 높은 비용이 발생한다는 문제가 있어요.
시스템은 어떤 기준으로 이벤트 경계를 탐지하나요?
단순히 고정된 시간이나 시각적 참신성만 이용하는 것이 아니라, 시각적 맥락 변화, 위치나 움직임의 변화, 나레이션, 사물/도구 상호작용 등 다양한 증거를 감지해서 경계를 탐지해요.
이 시스템을 사용하면 어떤 장점이 있나요?
온프레미스 환경에서 개인 정보 보호 제약을 지키면서도, 비디오 데이터를 간결하고 감사 가능한 문서로 만들어 검색 기능을 제공할 수 있어요.