비디오 디레인닝을 위한 S3VD 프레임워크 제안 — AI 생성 일러스트AI 일러스트
리서치 연구

비디오 디레인닝을 위한 S3VD 프레임워크 제안

S3VD: Semantic-Guidance Spatio-Temporal Scanning for Video Deraining

arXiv9월 21일 발표 · 3분 · 심사 전 논문

폭우로 인한 고주파 디테일 손실과 모션 블러를 극복하고자, 비디오 복원(Deraining)을 위한 S3VD 프레임워크가 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. S3VD는 DINOv2 기반의 의미론적 융합(MSSF)과 이중 게이팅 Mamba(DG-Mamba) 구조를 결합하여 공간-시간 상관관계를 최적화합니다.
  2. 기존 효율적인 모델들이 어려움을 겪던 공간적/시간적 맥락 정보를 보강하여, 악조건 환경 영상의 시각 정보 신뢰도를 높였습니다.
  3. 실험 결과, S3VD는 기존 Mamba 기반 모델 대비 평균 0.84 dB PSNR 향상을 달성하며 비디오 디레인닝 분야 최고 성능을 입증했습니다.

폭우는 고주파 디테일을 손상시키고 모션 블러를 유발하여 야외 비디오의 신뢰도를 크게 떨어뜨립니다. 이러한 문제를 해결하기 위해, 본 연구에서는 영상 디레인닝을 위한 S3VD(Semantic-Guidance Spatio-Temporal Scanning) 프레임워크를 제안합니다. 이 프레임워크는 State Space Models (SSMs), 특히 Mamba가 비가 오는 영상의 열악한 시각적 표현에 직면했을 때 2D 공간 의미론을 보존하고 3D 시공간 상관관계를 모델링하는 데 어려움을 겪는 한계를 극복하는 것을 목표로 합니다.

S3VD는 두 가지 핵심 혁신 요소를 갖습니다. 첫째, Multi-Scale Semantic Fusion (MSSF) Module은 DINOv2에서 얻은 시간적 의미론적 사전 지식을 통합하여 정확한 특징 표현을 유도하고, Mamba의 1D 평탄화 과정에서 발생하는 국소 의미 맥락 손실에 대응합니다. 둘째, Spatio-Temporal Scanning Fusion (STSF) Module은 공간-시간 스캐닝 메커니즘과 Decoupled-Gating Mamba (DG-Mamba) 레이어를 도입했습니다. DG-Mamba는 두 개의 독립 게이트를 사용하여 입력 클립 내의 선행 및 후속 문맥 정보를 적응적으로 제어함으로써, 프레임 내부와 프레임 간 상관관계 모델링을 최적화합니다.

비디오 디레인닝 실험 결과에 따르면, S3VD는 기존 Mamba 기반의 기준 모델들보다 평균 0.84 dB PSNR 향상을 달성하며 해당 분야에서 최고 성능(state-of-the-art)을 입증했습니다.

용어 풀이

벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · S3VD: Semantic-Guidance Spatio-Temporal Scanning for Video Deraining같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv