모델 도구

단일 사진으로 360도 회전 비디오를 만드는 LoRA 공개

pablodawson/MiniMax-H3-360-Orbit-LoRA

HFHugging Face발표일 미상 · 3분

MiniMax-H3 모델용 LoRA 어댑터가 공개되어, 단일 사진만으로도 360도 회전하는 연속적이고 정지된 시간의 비디오를 생성할 수 있게 했습니다.

왜 중요해요AI 정리

단 한 장의 사진만으로도 피사체를 고정하고 카메라 움직임만을 이용해 끊김 없이 360도 회전하는 연속적인 영상을 만들 수 있게 되었어요.

세 줄 요약Hugging Face 원문 기반
  1. 이 기술은 장면 속 모든 사물과 인물을 완벽하게 고정하고 카메라 움직임(패럴랙스)만을 이용해 오빗을 구현하며, 시작 프레임으로 정확히 돌아오는 루프가 가능합니다.
  2. 기존 비디오 생성 모델의 이음매나 드리프트 문제를 해결하여, 시각적 오류 없이 긴 길이의 연속적인 영화 같은 장면 제작이 가능해졌습니다.
  3. 다만 학습 데이터가 인간 중심의 정지된 스플랫 클립으로 한정되어 있어, 인물 외 다른 주제나 다양한 비율에는 적용에 제한이 있을 수 있습니다.

MiniMax-H3 모델용 어댑터가 공개되어, 단 한 장의 사진만으로도 피사체가 정지된 상태를 유지하며 연속적인 360도 카메라 오빗 영상을 생성할 수 있습니다. 이 기술은 장면 속 모든 인물과 사물을 동일한 세계 위치와 자세로 고정하고, 카메라 패럴랙스만을 유일한 움직임의 원천으로 활용합니다. 특히, 클립이 시작 프레임으로 정확히 돌아오는 루프 구조를 구현하여, 시각적 단절 없이 긴 길이의 장면을 연결하거나 이어 붙이는 것이 가능해졌습니다.

기존의 Reference-to-video(Ref2VA) 방식은 입력 이미지를 느슨한 외형 참조로 다루어 클립이 특정 프레임에서 끝나지 못하는 한계가 있었습니다. 이 LoRA는 시작점과 끝점을 고정하는 First–last-frame generation (FL2VA) 방식을 개선하여, 모델에게 실제 기하학적으로 일관된 오빗을 학습시켰습니다. 이를 통해 카메라가 전체 궤도를 돌아도 부드러운 움직임과 함께 끊김 없이 원래의 시작 프레임으로 복귀하는 것이 가능합니다.

이 LoRA를 사용하기 위해서는 첫 번째 키프레임과 마지막 키프레임을 동일한 이미지로 설정해야 하며, 권장 설정으로는 MiniMax-H3 FL2VA 모델을 사용하고 768×768 해상도에서 73 프레임(약 3초)으로 설정하는 것이 좋습니다. 다만, 학습 데이터가 인간 중심의 정사각형 클립 28개로 한정되어 있어, 인물 외 다른 주제나 다양한 화면 비율에는 적용에 제한이 있을 수 있습니다.

용어 풀이

LoRA
모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
궁금한 점AI 정리 · 원문 기반
이 기술은 어떤 종류의 움직임을 구현할 수 있나요?

장면 속 모든 인물과 사물을 동일한 위치와 자세로 고정하고, 오직 카메라 패럴랙스만을 유일한 움직임의 원천으로 활용하여 360도 회전하는 영상을 만들 수 있어요. 특히 클립이 시작 프레임으로 정확히 돌아오는 루프 구조를 구현할 수 있습니다.

기존 비디오 생성 모델의 어떤 한계를 개선했나요?

기존 방식은 입력 이미지를 느슨한 외형 참조로 다루어 클립이 특정 프레임에서 끝나지 못하는 한계가 있었어요. 이 LoRA는 시작점과 끝점을 고정하는 방식을 개선하여, 카메라가 전체 궤도를 돌아도 끊김 없이 원래의 시작 프레임으로 복귀하도록 만들었어요.

이 기술을 사용하려면 어떤 조건이나 제한 사항이 있나요?

사용하기 위해서는 첫 번째 키프레임과 마지막 키프레임을 동일한 이미지로 설정해야 해요. 또한, 학습 데이터가 인간 중심의 정사각형 클립으로 한정되어 있어 인물 외 다른 주제나 다양한 화면 비율에는 적용에 제한이 있을 수 있습니다.

원문Hugging Face · pablodawson/MiniMax-H3-360-Orbit-LoRA
궁금한 점 3개AI 정리