음성 생성 및 편집을 위한 오픈소스 파운데이션 모델 AuK 공개 — AI 생성 일러스트AI 일러스트
모델 뉴스

음성 생성 및 편집을 위한 오픈소스 파운데이션 모델 AuK 공개

tencent/AuK

Hugging Face발표일 미상 · 2분

텐센트가 음성 생성 및 편집을 위한 오픈소스 파운데이션 모델 'AuK'를 공개하며, 코드와 가중치를 대중에 배포했습니다.

세 줄 요약Hugging Face 원문 기반
  1. 이 모델은 단일한 자연어 명령어만으로 제로샷 TTS부터 내용 수정, 감정 변화, 배경음 제거 등 광범위하고 복합적인 음성 편집 작업을 처리합니다.
  2. 기존에 개별 기능으로 분리되어 있던 다양한 오디오 작업을 하나의 인터페이스로 통합하여, 전문적인 음성 콘텐츠 제작 워크플로우를 혁신할 잠재력을 가집니다.
  3. 고품질 기본 모델(AuK)과 빠른 추론을 위한 경량화 버전(AuK-Flash)이 제공되며, MIT 라이선스로 공개되어 접근성이 높습니다.

AuK는 음성 생성 및 편집에 특화된 1.5B 규모의 파운데이션 모델입니다. 수백만 시간에 달하는 다양한 오디오 데이터로 학습되었으며, 단일한 자연어 명령어 인터페이스를 통해 TTS(Zero-shot TTS)부터 내용 수정, 음향적/준언어적 편집, 음성 향상 및 소스 분리까지 광범위하게 지원합니다.

이 모델은 다양한 오디오 작업을 하나의 통합된 인터페이스로 처리할 수 있도록 설계되었습니다. 구체적으로는 텍스트를 재작성하는 콘텐츠 수정, 피치나 속도를 조절하는 음향적 편집(Acoustic Editing) 외에도, 감정 변화나 발음 제거 같은 준언어적 편집(Paralinguistic Editing)이 가능합니다. 또한, 노이즈 제거와 음악 분리 등 복합적인 오디오 처리 작업도 지원합니다.

AuK는 고품질 생성을 위한 기본 모델인 AuK와 빠른 추론을 위해 경량화된 버전인 AuK-Flash 두 가지 변형으로 제공됩니다. 사용자는 허깅페이스나 ModelScope 같은 플랫폼에서 해당 를 다운로드하여 사용할 수 있으며, 모든 기능은 자연어 명령어를 통해 접근할 수 있습니다.

용어 풀이

제로샷
예시를 하나도 주지 않고 바로 과제를 시키는 방식.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문Hugging Face · tencent/AuK같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기