예산 인식 에이전트를 위한 장기 비디오 이해 프레임워크
Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding
arXiv긴 영상 분석 시 컴퓨팅 자원과 대역폭 제약이 큰 엣지 환경을 위해 'Caption-once, Frames-on-Demand(CFD)'라는 에이전트 프레임워크가 개발되었습니다.
- 비디오를 한 번만 처리하여 이벤트 구조와 클립별 로그로 이중 인덱스를 구축하고, 질의 시 필요한 순간에만 핵심 프레임을 불러 쓰는 것이 핵심입니다.
- 질문 유형을 판단하는 라우터 모듈이 시각적 정보(외형, 텍스트)와 시간 구조 정보를 분리 처리하여 자원 효율성을 극대화합니다.
- 이를 통해 긴 영상의 정확한 이해도를 유지하면서도 온라인 시각 처리를 대폭 줄여 효율성과 성능을 동시에 확보했습니다.
장시간 영상에 대한 이해는 컴퓨팅 자원과 대역폭 제약이 큰 엣지 환경에서 중요한 과제입니다. 기존 방식의 문제점은 시각 을 다운샘플링할 경우 시간적 구조가 손실되거나, 텍스트 메모리만 사용할 경우 세밀한 시각 속성을 놓치는 것입니다. 연구진은 언어 기억이 장거리 시간 구조를 잘 담아내는 반면, 픽셀 정보는 여전히 속성 수준의 인지에 결정적이라는 시각-언어 이중성을 발견했습니다.
이를 바탕으로 'Caption-once, Frames-on-Demand (CFD)'라는 예산 인식 프레임워크가 제안되었습니다. 이 시스템은 엣지에서 단 한 번의 오프라인 캡셔닝 과정을 수행하여, 이벤트 수준의 스토리 골격과 클립 수준의 마이크로 로그를 포함하는 이중 트랙 내러티브 인덱스를 구축하고 이를 캐시합니다.
질의가 발생하면 클라우드 측 MLLM이 이 인덱스를 활용하며, 핵심은 경량화된 'Visual-Need Router'입니다. 이 라우터는 질문 유형을 판단하여 지각적 질문(외형, 화면 텍스트 등)에 대해서만 바운디드 키프레임 검색을 트리거하고, 시간 구조 관련 질문은 언어 공간에서 처리하도록 합니다. 이를 통해 시각 접근 비용이 질의 조건부 비용으로 전환됩니다.
실험 결과는 CFD가 온라인 시각 처리를 대폭 줄이는 동시에 정확성과 효율성 간의 우수한 트레이드오프를 보여주었으며, 장기 영상 이해도를 효과적으로 유지할 수 있음을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.