활용 사례 연구

MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation

ARarXiv10월 1일 발표 · 1분 · 프리프린트

장거리 영상 생성이 컨텍스트 창 크기 제한에 걸려, 객체가 사라졌다가 다시 나타날 때 디테일이 손실되는 문제를 해결합니다.

세 줄 요약arXiv 원문 기반
  1. '모자이크 청크'라는 새로운 시공간 메모리 기법을 활용해, 시간과 공간을 아우르는 과거의 핵심 정보를 조합하여 비디오 생성 모델에 일관된 컨텍스트를 제공합니다.
  2. 이 기술 덕분에 영상 속 객체의 세부 묘사를 장기간 기억하고 재현할 수 있게 되어, 훨씬 더 사실적이고 일관성 높은 긴 영상을 만들 수 있습니다.
  3. 텍스트 기반(T2V)과 카메라 움직임 기반(I2V)의 장거리 재방문 시나리오를 다루는 'RememBench'에서 그 성능이 검증되었습니다.

장거리 영상 생성이 컨텍스트 창 크기 제한에 걸려, 객체가 사라졌다가 다시 나타날 때 디테일이 손실되는 문제를 해결합니다.

원문arXiv · MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
원문 보기arXiv