심볼 기반 음악 생성 모델 YuE2의 기능과 성능
multimodal-art-projection/YuE
GitHubYuE2는 텍스트와 스타일 지시어만으로도 완성도 높은 음악을 생성하는 최첨단 모델입니다. 특히, 음악을 심볼(악보) 단계에서 계획하고 오디오로 구현한다는 점이 특징입니다.
- 단순한 생성을 넘어, 사용자가 악보 단계에서 멜로디와 화음을 직접 확인하고 수정할 수 있는 '화이트박스' 인터페이스를 제공하여 제작 통제력을 극대화했습니다.
- 신곡 생성 외에도 기존 곡을 새로운 스타일로 재해석하는 커버링 기능과 에이전트 기반의 전문적인 편집까지 지원하며 활용 범위가 넓습니다.
- WildSongBench 등 주요 벤치마크에서 최고 수준의 성능을 입증하며, 음악 창작 과정 전반에 걸쳐 강력한 혁신성을 보여줍니다.
YuE2는 심볼(악보)과 오디오 음악 생성을 통합하여 최첨단 품질의 음악을 생성하는 모델입니다. 사용자는 가사와 스타일 를 제공하면, 모델이 먼저 멜로디와 화음 계획(melody-and-chord plan)을 작성하고 이를 완전한 노래로 구현할 수 있습니다. 이 과정에서 멜로디와 코드는 명시적인 제어 요소가 되어 사람이 검사하거나 수정할 수 있는 '화이트박스' 인터페이스를 제공하여 제작 통제력을 높였습니다.
단순히 음악을 생성하는 것을 넘어, YuE2는 다양한 활용 범위를 가집니다. 기존 녹음된 곡을 전사(transcribe)한 후 새로운 스타일로 재해석하는 커버링이 가능하며, 와 대화하며 악보, 편곡, 가사를 수정하는 전문적인 편집 기능도 지원합니다. 이 기능을 통해 사용자는 의도한 작곡의 세부 사항을 검사하고 개입하여 새로운 녹음을 생성할 수 있습니다.
기술적으로 YuE2는 AR–NAR Mixture-of-Transformers 백본 구조를 사용하여 점수와 의미론적 을 자기회귀적으로 예측하며, 이후 흐름 매칭(flow matching)으로 음향 라텐트를 생성하고 VAE가 이를 스테레오 오디오로 디코딩합니다. 결과에 따르면, YuE2 (best-of-8)는 WildSongBench에서 6.9632의 SongBench Avg를 달성하여 평가된 설정 중 가장 높은 평균값을 기록했습니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.