비디오 확산 모델 기반 희소 시점 4D 가우시안 스플래팅 개선 연구
4DGS-Fixer: Generative Sparse-View 4D Gaussian Splatting with Iterative Refinement Guided by Video Diffusion Priors
arXiv희소한 영상 자료만으로 움직이는 동적 3D 장면을 재구성하는 어려움을 해결하기 위해, 비디오 확산 모델 기반의 반복 개선 프레임워크를 제안했습니다.
- 다중 시점 깊이 맵 추정으로 초기 기하학 정보를 보강하고, 비디오 복원 모델로 생성된 가상 데이터를 추가 감독 신호로 활용하여 4DGS를 정교하게 개선합니다.
- 기존 방식의 한계였던 부족한 관측 정보 문제를 해결하며, 적은 자료만으로도 일관성 있고 완전한 동적 장면 재현이 가능해졌습니다.
- 실제 벤치마크 데이터셋에서 기존 최고 성능 대비 약 2 dB PSNR 개선을 달성하며, 동적 장면 재구성의 새로운 기준을 제시했습니다.
본 논문은 희소한 영상 자료만으로 움직이는 동적 장면을 합성하는 과정의 어려움을 다룹니다. 기존 방법들은 기하학적 사전 정보나 밀도 제어 전략 등을 사용하지만, 관측 부족과 누락된 장면 정보로 인해 발생하는 근본적인 문제(ill-posed problem)를 해결하기 어렵다는 한계가 있었습니다. 특히 희소 시점 4D 가우시안 스플래팅(4DGS)은 입력 뷰가 적을 경우 기하학적 초기화가 불완전하여, 장면의 넓은 영역이 충분한 가우시안 지원 없이 남아있어 후속 최적화 과정에서 복구가 어렵습니다.
이를 해결하기 위해 연구진은 비디오 기반의 반복 개선 프레임워크를 제안했습니다. 먼저 다중 뷰 깊이 맵을 추정하고 이를 결합하여 밀집된 포인트 클라우드를 생성함으로써, 동적 4DGS 표현에 보다 완전한 기하학적 초기화 정보를 제공합니다. 이후 사전 학습된 비디오 복원 모델을 활용해 새로운 카메라 궤적을 따라 렌더링된 시퀀스를 정제하고, 이 복원된 시퀀스가 4DGS를 반복적으로 개선하는 가상 감독 신호(pseudo-supervision) 역할을 수행하도록 합니다.
실제 사용되는 데이터셋에서 실험한 결과, 제안된 방법은 기존의 최고 성능을 기록했던 방식보다 월등히 뛰어난 성능을 보여주었습니다. 구체적으로는 약 2 dB PSNR 개선을 달성하며, 적은 자료만으로도 일관성과 완전성을 갖춘 동적 장면 재현이 가능함을 입증했습니다.
용어 풀이
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.