영상 기반의 구성적 세계 재현 기술 'WorldSculpt'
WorldSculpt: Generating Compositional Worlds from Grounded Videos
arXiv복잡하게 물체가 뒤섞인 장면을 개별 객체 단위로 분리하여 3차원 구조를 재구성하는 새로운 기술입니다.
- 장면 전체 학습 없이도 심하게 가려진 대형 복잡 장면을 성공적으로 재구성하며, 관련 고밀도 벤치마크(UE-MeshyScene)를 제시했습니다.
- 게임, AR/VR, 로봇 공학 등 객체별 분리 및 구조화가 필수적인 다양한 산업 분야에 활용 가능한 기반 기술입니다.
- 단일 객체 생성 모델을 다중 시점 관찰에 적용하는 패러다임을 통해, 장면 복잡도와 가려짐 정도가 높을수록 성능이 향상됩니다.
본 연구는 수백 개의 물체가 뒤섞인 복잡한 장면을 개별 객체 단위로 분리하여 3차원 구조를 재구성하는 문제를 다룹니다. 게임, AR/VR, 시뮬레이션 및 로봇 공학과 같은 다운스트림 애플리케이션에서는 이러한 구성적 표현이 필수적입니다. 물체가 서로 심하게 가려지는 밀집된 장면의 경우, 기존 방식들은 단일한 표현으로 장면을 재구성하거나 가려진 영역에서 불완전한 기하학 구조를 남기는 한계가 있었습니다.
연구진은 강력한 단일 객체 3D 생성 사전 지식(prior)을 다중 시점 관찰에 적용하는 패러다임을 제시했습니다. 이를 위해 Pixal3D 모델을 확장하여, 객체 생성을 여러 각도의 관측 정보에 기반하도록 했습니다. 이 방법론은 장면 전체에 대한 학습 없이도 심하게 가려진 대규모 장면으로 일반화되는 것을 입증하며, 해당 패러다임의 실현 가능성과 확장성을 보여주었습니다.
또한, 수백 개의 객체와 개별 객체 주석 및 정답 메쉬를 포함하는 사실적인 인 UE-MeshyScene을 새롭게 제시했습니다. 이 방법은 단일 객체, 제어된 다중 객체 환경뿐만 아니라 UE-MeshyScene 평가에서도 이전 접근 방식보다 일관되게 우수한 성능을 보였으며, 특히 장면의 복잡도와 가려짐 정도가 증가할수록 성능 향상이 두드러졌습니다. 나아가 생성된 3DGS 월드를 구성적 메쉬 장면으로 변환하는 등 광범위한 적용 가능성을 입증했습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.