LongCat-Video: 고화질 장시간 영상 생성 기반 모델
meituan-longcat/LongCat-Video
GitHub메이뚜안의 LongCat-Video는 텍스트, 이미지, 비디오 연속 등 다양한 작업을 하나의 프레임워크로 처리하는 대규모 기반 영상 생성 모델입니다.
LongCat-Video는 하나의 모델로 텍스트, 이미지, 비디오 연속 등 다양한 작업을 처리하며 고화질의 장시간 영상을 효율적으로 생성할 수 있다는 점이 중요해요.
- 특히 시간적/공간적 축 모두에서 코스-투-파인 생성을 적용하여 색상 변질이나 품질 저하 없이 고화질의 장시간 비디오를 높은 효율로 생성하는 것이 핵심 기술입니다.
- 단순한 영상 생성을 넘어 '세계 모델' 구현의 초석을 다졌다는 점에서 의미가 크며, 현존 최고 수준의 오픈소스 및 상업적 결과물에 필적합니다.
- 최신 아바타 버전(Avatar-1.5)은 정교한 입술 동기화와 안정성을 제공하며, 최상의 결과를 위해 상세한 프롬프트 작성과 적절한 하드웨어 환경 설정이 중요합니다.
LongCat-Video는 13.6B 를 가진 기반(foundational) 비디오 생성 모델입니다. 이 모델은 텍스트-투-비디오, 이미지-투-비디오, 그리고 비디오 연속 등 세 가지 주요 작업을 단일 아키텍처 내에서 통합적으로 처리할 수 있습니다. 하나의 모델로 모든 작업을 지원하며 각 개별 작업에서도 일관되게 강력한 성능을 보여주는 것이 특징입니다.
LongCat-Video는 시간적 및 공간적 축 모두에 걸쳐 코스-투-파인 생성 전략과 블록 희소 어텐션(Block Sparse Attention)을 적용하여 효율성을 높였습니다. 이를 통해 $720p$, $30fps$ 비디오를 몇 분 안에 생성할 수 있으며, 색상 변질이나 품질 저하 없이 장시간 영상을 제작하는 데 강점을 보입니다. 또한 다중 보상 그룹 상대 정책 최적화(GRPO)를 통해 최고 수준의 성능을 달성했습니다.
최신 버전인 LongCat-Video-Avatar-1.5는 오디오 기반 인간 영상 생성을 위한 업그레이드된 프레임워크입니다. 이 모델은 Wav2Vec2 대신 Whisper-Large를 사용하여 더 정확한 입술 동기화와 높은 물리적 합리성 및 시간적 안정성을 달성했습니다. 또한 Audio-Text-to-Video, Audio-Text-Image-to-Video 등 다양한 오디오 입력 모드를 지원합니다.
용어 풀이
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
이 모델은 어떻게 고화질의 장시간 영상을 만들 수 있나요?
시간적 축과 공간적 축 모두에 코스-투-파인 생성 전략과 블록 희소 어텐션을 적용했어요. 이를 통해 색상 변질이나 품질 저하 없이 장시간 영상을 제작하는 데 강점을 보여요.
최신 아바타 버전은 어떤 기능을 개선했나요?
오디오 기반 인간 영상 생성을 위한 업그레이드된 오픈소스 프레임워크예요. Wav2Vec2 대신 Whisper-Large를 사용해서 입술 동기화와 시간적 안정성이 높아졌어요. 또한 Audio-Text-to-Video 등 다양한 오디오 입력 모드를 지원해요.
LongCat-Video는 어떤 종류의 작업을 처리할 수 있나요?
텍스트를 비디오로 만드는 작업(Text-to-video), 이미지를 비디오로 만드는 작업(Image-to-video), 그리고 기존 비디오를 이어가는 연속 생성 등 세 가지 주요 작업을 하나의 아키텍처에서 통합적으로 처리할 수 있어요.