활용 사례 연구
MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
ARarXiv
장거리 영상 생성이 컨텍스트 창 크기 제한에 걸려, 객체가 사라졌다가 다시 나타날 때 디테일이 손실되는 문제를 해결합니다.
세 줄 요약
- '모자이크 청크'라는 새로운 시공간 메모리 기법을 활용해, 시간과 공간을 아우르는 과거의 핵심 정보를 조합하여 비디오 생성 모델에 일관된 컨텍스트를 제공합니다.
- 이 기술 덕분에 영상 속 객체의 세부 묘사를 장기간 기억하고 재현할 수 있게 되어, 훨씬 더 사실적이고 일관성 높은 긴 영상을 만들 수 있습니다.
- 텍스트 기반(T2V)과 카메라 움직임 기반(I2V)의 장거리 재방문 시나리오를 다루는 'RememBench'에서 그 성능이 검증되었습니다.
장거리 영상 생성이 컨텍스트 창 크기 제한에 걸려, 객체가 사라졌다가 다시 나타날 때 디테일이 손실되는 문제를 해결합니다.