LLM 기반 코드 렌더링 뮤직비디오 제작 과정 공개 — AI 생성 일러스트
개발도구 뉴스공식 자료어제 발표

LLM 기반 코드 렌더링 뮤직비디오 제작 과정 공개

mexicat/pdoom-video

GitHub9월 27일 발표 · 3분

노래의 시간에 따라 모든 시각적 요소가 결정되는 코드 기반의 생성형 뮤직비디오를 공개했습니다.

세 줄 요약GitHub 원문 기반
  1. 일반적인 플랫폼 압축과 달리, 프레임당 최대 324개의 서브프레임을 계산하여 움직임이 끊기지 않는 고화질의 결정론적 영상을 구현했습니다.
  2. 본 프로젝트는 거대 언어 모델(LLM)이 예술적 콘셉트 기획부터 오디오 분석, 렌더링 엔진 설계까지 전 과정에 걸쳐 활용될 수 있음을 보여줍니다.
  3. 고화질 출력을 위해서는 GPU 자원과 시간이 많이 소요되며, 안정적인 구동을 위해 특정 개발 환경 및 전문 도구 설치가 필수적입니다.

이 프로젝트는 노래의 시간에 따라 모든 시각적 요소가 결정되는 생성형, 코드 기반의 뮤직비디오입니다. 모든 프레임은 노래 시간의 결정론적 함수로 작동하며, 브라우저에서의 라이브 미리보기와 오프라인 1080p60 또는 4K60으로 내보내는 결과물이 동일합니다. 특히 일반적인 플랫폼 압축 환경과 달리, 로컬에서 렌더링할 경우 움직임이 필요한 부분에 최대 324개의 서브프레임을 계산하여 끊김 없는 고화질 영상을 구현했습니다.

본 뮤직비디오는 (LLM)인 Claude (Opus 5.5)를 활용하여 제작되었습니다. 콘셉트 및 전반적인 트릿먼트는 물론, 가사 정렬과 오디오 분석, 그리고 최종 렌더러 설계에 이르기까지 대화 과정을 통해 모든 단계가 구체화되었습니다. 프로젝트의 기술 스택은 Demucs와 Whisper 등을 이용한 타이밍 데이터 생성부터 시작하여, TypeScript + three.js 기반의 렌더러 코어 및 다양한 장면 모듈로 구성되어 있습니다.

고해상도 출력을 위해서는 복잡한 렌더링 과정이 필요합니다. 예를 들어, `--shutter 0.2`와 같은 를 사용하여 프레임당 여러 서브프레임을 평균화함으로써 움직이는 물체가 연속적인 흐름으로 보이게 합니다. 또한, `scale 2` 옵션을 사용하면 모든 레이어와 셰이더가 물리적 해상도에서 렌더링되어 4K 출력이 가능하지만, 이 과정은 자원을 많이 소모하며 전체 노래를 렌더링하는 데 약 2.5시간이 소요되었습니다.

용어 풀이

거대 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
원문GitHub · mexicat/pdoom-video다음 이야기 · 2 / 4오픈소스 음성 클로닝 및 더빙 플랫폼 VoiceStudio 소개
원문 보기GitHub