3D 공간에서 카메라와 사물 움직임을 제어하는 생성 모델
Generative Cinematographer: Composing Camera and Object Motion in 3D
새로운 시스템 'Generative Cinematographer(GenCine)'는 단일 이미지를 편집 가능한 3차원 장면으로 변환하여, 카메라와 사물의 움직임을 동시에 정교하게 제어하는 기술입니다.
이 기술은 기존의 2차원적인 움직임 제어 방식이 가졌던 모호성을 해결하고, 카메라 시점 변화에도 기하학적 일관성을 유지하며 사물 움직임을 정교하게 제어할 수 있게 해요.
- 아티스트가 직접 카메라 경로를 지정하고 로컬 3D 모션 핸들을 사용해 피사체의 여러 부분을 독립적으로 움직이게 하며, 이 정보는 '가이드맵'으로 기록됩니다.
- 기존의 2차원-3차원 매핑 한계를 극복하여, 카메라 시점 변화에도 기하학적 일관성을 유지하고 사물 움직임을 정확하게 제어할 수 있습니다.
- 시스템은 실제 영상에서 움직임을 복구하고 합성 영상 데이터를 활용하며, 사전 학습된 모델에 경량 가이던스 브랜치를 적용해 작동합니다.
기존의 영상 생성 시스템은 주로 2차원 모션 궤적이나 희소한 드래그 신호에 의존하여 객체 움직임을 제어해왔습니다. 그러나 이러한 방식은 카메라와 객체가 동시에 움직일 때, 동일한 2D 궤적이 서로 다른 3D 움직임으로 해석될 수 있다는 모호성을 가집니다. 이에 연구진은 단일 이미지를 편집 가능한 3차원 장면 스캐폴드로 변환하는 'Generative Cinematographer(GenCine)' 시스템을 제시했습니다.
이 시스템에서는 아티스트가 카메라 경로를 지정하고, 로컬 3D 모션 핸들을 사용하여 선택된 전경 영역의 움직임을 공동으로 작성할 수 있습니다. 여러 개의 핸들은 피사체의 서로 다른 부분을 독립적으로 움직일 수 있게 하며, 이는 물리 시뮬레이터나 특정 범주에 기반한 사전 지식 없이도 부분적으로 강체 근사(piecewise-rigid approximation)를 제공합니다. 이러한 제어 정보는 '가이던스 맵'으로 투영되어 각 프레임에서 제어된 영역의 위치와 3D 좌표를 기록하며, 배경과 동일한 월드 좌표계 내에서 객체의 움직임을 설명할 수 있게 합니다.
GenCine은 실제 영상에서 관찰되는 움직임을 복구하고 합성 영상의 정지 상태 및 궤적 데이터를 활용하여 학습됩니다. 시스템은 사전 학습된 Wan 모델에 경량 가이던스 브랜치와 어댑터를 적용하여 이러한 제어 정보를 따르도록 훈련되었습니다. 실험 결과, 이 시스템은 카메라 상대 움직임의 일관성을 유지하고 시점 변화 하에서도 향상된 기하학적 일관성 및 다양한 실제 환경 장면에서 강력한 제어 가능성을 보여주었습니다.
용어 풀이
- LoRA
- 모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
기존 영상 생성 시스템의 움직임 제어 한계는 무엇인가요?
기존 방식은 주로 2차원 모션 궤적이나 드래그 신호에 의존해서 객체 움직임을 제어했어요. 이 때문에 카메라와 객체가 동시에 움직일 때, 동일한 2D 궤적이 서로 다른 3D 움직임으로 해석될 수 있는 모호성이 있었어요.
아티스트는 이 시스템에서 어떻게 사물의 움직임을 제어하나요?
아티스트가 카메라 경로를 지정하고, 로컬 3D 모션 핸들을 사용해서 선택된 전경 영역의 움직임을 공동으로 작성할 수 있어요. 여러 개의 핸들로 피사체의 다른 부분을 독립적으로 움직이게 하고, 이 정보는 '가이던스 맵'에 기록돼요.
GenCine 시스템은 어떤 데이터를 활용하여 학습되었나요?
이 시스템은 실제 영상에서 관찰되는 움직임과 합성 영상의 정지 상태 및 궤적 데이터를 활용해서 학습했어요. 사전 학습된 Wan 모델에 경량 가이던스 브랜치와 LoRA 어댑터를 적용하여 제어 정보를 따르도록 훈련되었어요.