모델 뉴스
음성 생성 및 편집을 위한 오픈소스 파운데이션 모델 AuK 공개
tencent/AuK
Hugging Face텐센트가 음성 생성 및 편집을 위한 오픈소스 파운데이션 모델 'AuK'를 공개하며, 코드와 가중치를 대중에 배포했습니다.
세 줄 요약
- 이 모델은 단일한 자연어 명령어만으로 제로샷 TTS부터 내용 수정, 감정 변화, 배경음 제거 등 광범위하고 복합적인 음성 편집 작업을 처리합니다.
- 기존에 개별 기능으로 분리되어 있던 다양한 오디오 작업을 하나의 인터페이스로 통합하여, 전문적인 음성 콘텐츠 제작 워크플로우를 혁신할 잠재력을 가집니다.
- 고품질 기본 모델(AuK)과 빠른 추론을 위한 경량화 버전(AuK-Flash)이 제공되며, MIT 라이선스로 공개되어 접근성이 높습니다.
AuK는 음성 생성 및 편집에 특화된 1.5B 규모의 파운데이션 모델입니다. 수백만 시간에 달하는 다양한 오디오 데이터로 학습되었으며, 단일한 자연어 명령어 인터페이스를 통해 TTS(Zero-shot TTS)부터 내용 수정, 음향적/준언어적 편집, 음성 향상 및 소스 분리까지 광범위하게 지원합니다.
이 모델은 다양한 오디오 작업을 하나의 통합된 인터페이스로 처리할 수 있도록 설계되었습니다. 구체적으로는 텍스트를 재작성하는 콘텐츠 수정, 피치나 속도를 조절하는 음향적 편집(Acoustic Editing) 외에도, 감정 변화나 발음 제거 같은 준언어적 편집(Paralinguistic Editing)이 가능합니다. 또한, 노이즈 제거와 음악 분리 등 복합적인 오디오 처리 작업도 지원합니다.
AuK는 고품질 생성을 위한 기본 모델인 AuK와 빠른 추론을 위해 경량화된 버전인 AuK-Flash 두 가지 변형으로 제공됩니다. 사용자는 허깅페이스나 ModelScope 같은 플랫폼에서 해당 를 다운로드하여 사용할 수 있으며, 모든 기능은 자연어 명령어를 통해 접근할 수 있습니다.
용어 풀이
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.