심볼 기반 음악 생성 모델 YuE2의 기능과 성능 — AI 생성 일러스트
개발도구 뉴스

심볼 기반 음악 생성 모델 YuE2의 기능과 성능

multimodal-art-projection/YuE

GitHub9월 16일 발표 · 3분

YuE2는 텍스트와 스타일 지시어만으로도 완성도 높은 음악을 생성하는 최첨단 모델입니다. 특히, 음악을 심볼(악보) 단계에서 계획하고 오디오로 구현한다는 점이 특징입니다.

세 줄 요약GitHub 원문 기반
  1. 단순한 생성을 넘어, 사용자가 악보 단계에서 멜로디와 화음을 직접 확인하고 수정할 수 있는 '화이트박스' 인터페이스를 제공하여 제작 통제력을 극대화했습니다.
  2. 신곡 생성 외에도 기존 곡을 새로운 스타일로 재해석하는 커버링 기능과 에이전트 기반의 전문적인 편집까지 지원하며 활용 범위가 넓습니다.
  3. WildSongBench 등 주요 벤치마크에서 최고 수준의 성능을 입증하며, 음악 창작 과정 전반에 걸쳐 강력한 혁신성을 보여줍니다.

YuE2는 심볼(악보)과 오디오 음악 생성을 통합하여 최첨단 품질의 음악을 생성하는 모델입니다. 사용자는 가사와 스타일 를 제공하면, 모델이 먼저 멜로디와 화음 계획(melody-and-chord plan)을 작성하고 이를 완전한 노래로 구현할 수 있습니다. 이 과정에서 멜로디와 코드는 명시적인 제어 요소가 되어 사람이 검사하거나 수정할 수 있는 '화이트박스' 인터페이스를 제공하여 제작 통제력을 높였습니다.

단순히 음악을 생성하는 것을 넘어, YuE2는 다양한 활용 범위를 가집니다. 기존 녹음된 곡을 전사(transcribe)한 후 새로운 스타일로 재해석하는 커버링이 가능하며, 와 대화하며 악보, 편곡, 가사를 수정하는 전문적인 편집 기능도 지원합니다. 이 기능을 통해 사용자는 의도한 작곡의 세부 사항을 검사하고 개입하여 새로운 녹음을 생성할 수 있습니다.

기술적으로 YuE2는 AR–NAR Mixture-of-Transformers 백본 구조를 사용하여 점수와 의미론적 을 자기회귀적으로 예측하며, 이후 흐름 매칭(flow matching)으로 음향 라텐트를 생성하고 VAE가 이를 스테레오 오디오로 디코딩합니다. 결과에 따르면, YuE2 (best-of-8)는 WildSongBench에서 6.9632의 SongBench Avg를 달성하여 평가된 설정 중 가장 높은 평균값을 기록했습니다.

용어 풀이

프롬프트
AI에게 주는 지시나 질문 글.
제로샷
예시를 하나도 주지 않고 바로 과제를 시키는 방식.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문GitHub · multimodal-art-projection/YuE
원문 보기GitHub