LongCat-Video: 고화질 장시간 영상 생성 기반 모델 — AI 생성 일러스트
개발도구 도구

LongCat-Video: 고화질 장시간 영상 생성 기반 모델

meituan-longcat/LongCat-Video

GitHub5월 27일 발표 · 3분

메이뚜안의 LongCat-Video는 텍스트, 이미지, 비디오 연속 등 다양한 작업을 하나의 프레임워크로 처리하는 대규모 기반 영상 생성 모델입니다.

왜 중요해요AI 정리

LongCat-Video는 하나의 모델로 텍스트, 이미지, 비디오 연속 등 다양한 작업을 처리하며 고화질의 장시간 영상을 효율적으로 생성할 수 있다는 점이 중요해요.

세 줄 요약GitHub 원문 기반
  1. 특히 시간적/공간적 축 모두에서 코스-투-파인 생성을 적용하여 색상 변질이나 품질 저하 없이 고화질의 장시간 비디오를 높은 효율로 생성하는 것이 핵심 기술입니다.
  2. 단순한 영상 생성을 넘어 '세계 모델' 구현의 초석을 다졌다는 점에서 의미가 크며, 현존 최고 수준의 오픈소스 및 상업적 결과물에 필적합니다.
  3. 최신 아바타 버전(Avatar-1.5)은 정교한 입술 동기화와 안정성을 제공하며, 최상의 결과를 위해 상세한 프롬프트 작성과 적절한 하드웨어 환경 설정이 중요합니다.

LongCat-Video는 13.6B 를 가진 기반(foundational) 비디오 생성 모델입니다. 이 모델은 텍스트-투-비디오, 이미지-투-비디오, 그리고 비디오 연속 등 세 가지 주요 작업을 단일 아키텍처 내에서 통합적으로 처리할 수 있습니다. 하나의 모델로 모든 작업을 지원하며 각 개별 작업에서도 일관되게 강력한 성능을 보여주는 것이 특징입니다.

LongCat-Video는 시간적 및 공간적 축 모두에 걸쳐 코스-투-파인 생성 전략과 블록 희소 어텐션(Block Sparse Attention)을 적용하여 효율성을 높였습니다. 이를 통해 $720p$, $30fps$ 비디오를 몇 분 안에 생성할 수 있으며, 색상 변질이나 품질 저하 없이 장시간 영상을 제작하는 데 강점을 보입니다. 또한 다중 보상 그룹 상대 정책 최적화(GRPO)를 통해 최고 수준의 성능을 달성했습니다.

최신 버전인 LongCat-Video-Avatar-1.5는 오디오 기반 인간 영상 생성을 위한 업그레이드된 프레임워크입니다. 이 모델은 Wav2Vec2 대신 Whisper-Large를 사용하여 더 정확한 입술 동기화와 높은 물리적 합리성 및 시간적 안정성을 달성했습니다. 또한 Audio-Text-to-Video, Audio-Text-Image-to-Video 등 다양한 오디오 입력 모드를 지원합니다.

용어 풀이

파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
오픈소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
궁금한 점AI 정리 · 원문 기반
이 모델은 어떻게 고화질의 장시간 영상을 만들 수 있나요?

시간적 축과 공간적 축 모두에 코스-투-파인 생성 전략과 블록 희소 어텐션을 적용했어요. 이를 통해 색상 변질이나 품질 저하 없이 장시간 영상을 제작하는 데 강점을 보여요.

최신 아바타 버전은 어떤 기능을 개선했나요?

오디오 기반 인간 영상 생성을 위한 업그레이드된 오픈소스 프레임워크예요. Wav2Vec2 대신 Whisper-Large를 사용해서 입술 동기화와 시간적 안정성이 높아졌어요. 또한 Audio-Text-to-Video 등 다양한 오디오 입력 모드를 지원해요.

LongCat-Video는 어떤 종류의 작업을 처리할 수 있나요?

텍스트를 비디오로 만드는 작업(Text-to-video), 이미지를 비디오로 만드는 작업(Image-to-video), 그리고 기존 비디오를 이어가는 연속 생성 등 세 가지 주요 작업을 하나의 아키텍처에서 통합적으로 처리할 수 있어요.

원문GitHub · meituan-longcat/LongCat-Video
궁금한 점 3개AI 정리